מערכת הסוכנים AVO של NVIDIA השלימה את כל סביבות ARC-AGI-3 הציבוריות עם Claude Opus 5. התוצאה מדגישה את משקלם של זיכרון, כלים ופיקוח, אך אינה כוללת את מערכי התחרות החסויים.
NVIDIA דיווחה כי מערכת הסוכנים AVO השלימה את כל 183 השלבים ב־25 הסביבות של המערך הציבורי ב־ARC-AGI-3. המערכת קיבלה ציון RHAE של 100.00 וביצעה את המשימות ב־6,624 פעולות סביבה. הפוסט הטכני פורסם ב־21 באוגוסט ועודכן באותו ערב כדי להבהיר שהמספרים מתייחסים למערך הציבורי בלבד, ולא למערכים החצי־פרטיים או הפרטיים של התחרות.
מה נמדד ומה הפעיל את הסוכן
ARC-AGI-3 בנוי מסביבות אינטראקטיביות דמויות משחק. הסוכן נכנס אליהן בלי הוראות בשפה טבעית, בלי כללים מפורשים ובלי יעד שמוסבר מראש. הוא צריך לנסות פעולות, ללמוד מה השתנה, להסיק מהי המטרה ולשמור ידע בין שלבים. הציון משקלל גם השלמה וגם יעילות ביחס למספר הפעולות שנדרש ממשתמש אנושי בפעם הראשונה.
AVO השתמש ב־Claude Opus 5 כמודל הבסיס. התצפיות נמסרו למודל כרשת טקסט בגודל 64 על 64, בלי תמונה ובלי אסימוני תמונה. NVIDIA השוותה את הריצה ל־VISTA, שהשלימה גם היא את 183 השלבים עם אותו סוג מודל ב־7,542 פעולות. ההפרש הוא כ־12% במספר הפעולות, אך החברה מציינת שזו אינה השוואה מבוקרת: שתי המערכות שונות בייצוג הקלט, בזיכרון, בניהול ההקשר ובמנגנון ההפעלה.
גם ההשוואה לציון של כ־30% ש־ARC Prize מייחס ל־Claude Opus 5 לבדו אינה מודדת תוספת נקייה של 70 נקודות. הרצת AVO השתמשה בהגדרת חשיבה אחרת ובמערכת מלאה אחרת. התוצאה מראה שהמעטפת יכולה לשנות מאוד את הביצועים, אך אינה מפרידה את התרומה של כל רכיב.
הזיכרון והמפקח נמצאים במרכז
AVO שומרת תוצאות קודמות, בדיקות, פלטים וכלים בזיכרון מתמשך, כך שהסוכן אינו צריך לבנות מחדש את ההבנה בכל חלון הקשר. רכיב מפקח עוקב אחר המסלול הרחב ויכול להפנות את הסוכן לכיוון אחר כשהוא חוזר על ניסיונות או נתקע. המודל הראשי ממשיך לבחור פעולות ולבצע אותן; המפקח משמש שכבת בקרה נוספת.
המערכת לא נולדה עבור משחקים. מאמר AVO המקורי מתאר שבעה ימים של אופטימיזציה אוטונומית לליבות attention על מערכות DGX B200. במהלך הריצה נבדקו יותר מ־500 כיוונים ונשמרו 40 גרסאות קוד. בתצורות שנבדקו, הליבות שנמצאו היו מהירות בעד 3.5% מ־cuDNN ובעד 10.5% מ־FlashAttention-4. מבחן ARC נועד לבדוק אם אותו מבנה עבודה עובר מתחום הנדסת GPU לסביבה אינטראקטיבית שונה.
המשמעות למי שבונה סוכנים
עבור צוותי פיתוח, המסקנה המעשית היא שבחירת מודל לבדה אינה מנבאת את איכות הסוכן. ניהול זיכרון, תכנון כלי העבודה, משוב מהסביבה, אימות והתאוששות מכישלון יכולים לשנות את התוצאה ואת העלות. לכן השוואה בין שני מודלים דרך צ'אט או מבחן חד־פעמי עלולה להחמיץ את מה שקורה במערכת ארוכת טווח.
עדיין חסרות בדיקות חשובות. המערכים החסויים יקבעו אם הביצועים נשמרים מול משימות שלא היו זמינות לפיתוח. לא פורסם ניתוח עלות מלא, ולא בוצעה בדיקת הסרה שמבודדת את תרומת הזיכרון או המפקח. התוצאה הנוכחית חזקה במערך הציבורי ומעניינת ברמת תכנון המערכת, אך היא אינה הוכחה ליכולת כללית בכל סביבה ואינה הופכת את AVO למוצר מסחרי מוכן.
מקורות
- NVIDIA Technical Blog21.8.2026
- TechCrunch21.8.2026
- ARC Prize
VibeTech
כתב/ת טכנולוגיה ב-VibeTech



