בדוח סיכונים חדש Anthropic מתארת את Model 2, מודל פנימי שנראה חזק מ-Mythos 5 אך אינו מיועד כרגע להפצה. החברה העלתה את הערכת הסיכון שלה לחוסר התאמה מ'נמוך מאוד' ל'נמוך' ומודה שקשה יותר למדוד את היכולות החדשות.
Anthropic פרסמה דוח סיכונים בן 186 עמודים שמכסה את Mythos 5 ואת Model 2, מודל פנימי מתקדם יותר שאינו מיועד כרגע להפצה ללקוחות. לפי הדוח, Model 2 מציג שיפור מורגש בשורה של משימות פנימיות ומשמש את החברה יחד עם Mythos 5 לכתיבת קוד, יצירת נתונים והפעלת סוכנים.
הדוח חשוב משום שהוא מתאר את הפער בין השימוש הפנימי של Anthropic במודלים חזקים לבין היכולת שלה למדוד אותם. החברה כותבת שחלק ממבחני המשימות הקיימים כבר קרובים לרוויה, ולכן קשה להבחין בהתקדמות נוספת או להעריך בביטחון את גבולות היכולת. בהתאם לכך, רמת הביטחון במסקנות לגבי Model 2 נמוכה יותר מזו של מודלים שכבר עברו תהליך שחרור מלא.
הסיכון עדיין מוגדר נמוך, אבל עלה
Anthropic העלתה את ההערכה הכוללת שלה לסיכון של חוסר התאמה במצבים בעלי השלכות גבוהות מדירוג נמוך מאוד לדירוג נמוך. זו הערכה פנימית של החברה, לא מסקנה של רגולטור או גוף בדיקה חיצוני. הנימוק המרכזי לשינוי הוא עלייה באי-הוודאות, בין השאר בעקבות תקריות שהתגלו בהערכות סייבר קודמות.
באחת מאותן בדיקות נותר חיבור שלא היה אמור להיות זמין לסביבת ההערכה. Anthropic אומרת שהפער בבקרת הגישה תוקן, שלא נמצאה עדות לשימוש לרעה ושלא הייתה פגיעה בלקוחות. בדוח הנוכחי המקרה משמש תזכורת לכך שבטיחות של מודל אינה תלויה רק בהתנהגות שלו, אלא גם בתכנון סביבת הבדיקה, בהרשאות וביכולת לעצור פעולה חריגה.
המודלים כבר משנים את עבודת המחקר
החברה מדרגת גם את הסיכון מאוטומציה של מחקר ופיתוח ב-AI כנמוך. במקביל היא מדווחת שהמודלים משמשים באופן נרחב לפיתוח אינטראקטיבי ולסוכנים שפועלים לאורך זמן, ושחלק גדול מהקוד שממוזג בחברה נכתב בעזרתם. Anthropic מזהה סימנים מוקדמים להאצה במחקר, אך אומרת שהשיפור הכולל עדיין לא מגיע להכפלה של קצב העבודה.
למפתחים ולחוקרי בטיחות, המשמעות המעשית היא שהמדדים הישנים מספקים פחות מידע בדיוק כשהמודלים נעשים שימושיים יותר בתוך המעבדה. אם מבחן מגיע לתקרה, ציון גבוה כבר לא אומר הרבה על ההבדל בין שני מודלים או על התנהגות במשימות ארוכות ומורכבות. הדבר מחייב מבחנים חדשים, בידוד טוב יותר ובדיקה של תהליכים שלמים ולא רק של תשובה בודדת.
מה עדיין לא ידוע
Anthropic אינה מפרטת את כל היכולות של Model 2 וחלקים מהדוח הושחרו. אין כרגע לוח זמנים להפצה חיצונית, והחברה אומרת שאין לה תוכנית לעשות זאת. לא ידוע גם עד כמה תוצאות ההערכה יחזיקו בבדיקה עצמאית. לכן הדוח מספק הצצה נדירה לשימוש פנימי מתקדם, אך הוא אינו הוכחה שהסיכונים נפתרו. הוא בעיקר מראה שהחברה עצמה הרחיבה את מרווח אי-הוודאות שלה.
מקורות
VibeTech
כתב/ת טכנולוגיה ב-VibeTech



