טכנאים בודקים ארון מאיצי NVIDIA Groq 3 LPX בפתח תא בדיקות אקלים
בינה מלאכותית

NVIDIA החלה בייצור מלא של Groq 3 LPX

VibeTech 3 דק׳ קריאה 1 צפיות25 באוגוסט 2026

המאיץ מיועד לשלב הפקת הטוקנים במערכות Vera Rubin, ו-Nebius תהיה לקוח הענן הראשון. מדידה אחת הראתה 3,431 טוקנים לשנייה, אך עדיין חסרים מחיר, צריכת חשמל ובדיקות רחבות.

NVIDIA הודיעה שמאיץ ההסקה Groq 3 LPX עבר לייצור מלא. המוצר מצטרף למערכות Vera Rubin NVL72 כדי לטפל בחלק הרגיש לזמן של הרצת מודלי שפה: הפקת הטוקנים אחרי שהקלט כבר עובד. Nebius הוכרזה כספקית ענן ה־AI הראשונה שתאמץ את המערכת.

חלוקת העבודה בתוך המערכת

הרצת מודל שפה גדול מתחלקת בקירוב לשני שלבים. בשלב הראשון המערכת קוראת את ההנחיה, המסמכים וההיסטוריה ומחשבת את ההקשר. זהו שלב ה־prefill, שמתאים לעיבוד מקבילי על GPU. בשלב השני המודל מפיק את התשובה טוקן אחרי טוקן. השלב הזה נקרא decode, וההמתנה בין טוקנים משפיעה ישירות על התחושה בשיחה, בסוכן קולי או בכלי תכנות אינטראקטיבי.

בארכיטקטורה החדשה, מעבדי Rubin מטפלים בהקשר ובחישוב המקבילי, ואילו Groq 3 LPX מקבל את עבודת ה־decode. לפי NVIDIA, ניתן לשלב עד 256 מאיצי LP30 במערכת rack אחת ולחבר אותם ישירות לסביבת Vera Rubin. החיבור נועד להימנע מהעברת עבודה דרך שכבת רשת חיצונית בכל מעבר בין שני השלבים.

המהלך שונה מהוספת עוד GPU זהה לאשכול. NVIDIA מציעה כאן מאיץ ייעודי לשלב מסוים ומנסה לתזמן בין שני סוגי חומרה. עבור מפעיל ענן, המשמעות היא שיש יותר רכיבים לתכנן ולנטר, אבל גם אפשרות להקצות כל משימה לחומרה שמתאימה לה.

מה מראות המדידות הראשונות

Artificial Analysis מדדה 3,431 טוקני פלט בשנייה עבור Gemma 4 31B עם הקשר קלט של מאה אלף טוקנים, על נקודת קצה פרטית שאירחה NVIDIA. בהקשר של עשרת אלפים טוקנים נמדדו 3,382 טוקנים בשנייה. התוצאה מצביעה על קצב הפקה גבוה בתצורה שנבדקה, אך היא אינה מדד כללי לכל מודל או לכל עומס.

NVIDIA פרסמה גם תוצאה חציונית של 4,767 טוקנים בשנייה ב־SPEED-Bench. זו בדיקה שהחברה הריצה בעצמה, ולכן צריך להפריד בינה לבין המדידה של Artificial Analysis. בשני המקרים חסרים כרגע נתונים מלאים על מספר המשתמשים במקביל, זמן התגובה מקצה לקצה, צריכת החשמל ועלות ההפעלה.

מי ירגיש את ההבדל

הקהל המיידי הוא ספקי ענן וחברות שמפעילות סוכני AI בזמן אמת. קצב decode גבוה יכול לקצר את ההמתנה בתשובות ארוכות, בקול ובכלי עבודה שמבצעים רצף פעולות. הוא חשוב במיוחד כאשר ההנחיה כוללת הקשר ארוך, משום שהמשתמש מצפה להתחלת תשובה מהירה גם אחרי שהמערכת קראה הרבה מידע.

ללקוח קצה, המספר על המאיץ אינו מספיק. חוויית השימוש תלויה גם בתור, ברשת, בשלב ה־prefill, בכלי האבטחה ובשירות שמקיף את המודל. מפעיל שבוחן את LPX צריך למדוד עומס אמיתי עם המודלים שלו ולחשב תפוקה לוואט ולדולר, לא רק טוקנים לשנייה בהרצה אחת.

NVIDIA לא פרסמה מחיר, צריכת חשמל מלאה של rack או לוח אספקה מפורט ל־Nebius. גם אין עדיין סדרה רחבה של בדיקות עצמאיות על מודלים וגדלי אצווה שונים. המעבר לייצור מלא הופך את Groq 3 LPX ממפת דרכים לחומרה שאמורה להגיע ללקוחות, אבל היתרון הכלכלי והביצועים בשירות ציבורי יתבררו רק לאחר פריסות אמיתיות.

מקורות

  1. NVIDIA Blog24.8.2026
  2. NVIDIA Technical Blog
  3. SiliconANGLE24.8.2026
AINVIDIAGroq 3 LPXVera RubinNebius
VibeTech

VibeTech

כתב/ת טכנולוגיה ב-VibeTech