
פרק 11: רגשות בצורה של אלגוריתם
השבוע חוקרים באנתרופיק חיברו חיישנים למצב הפנימי של המודל החדש שלהם, וגילו שכשהוא נכשל שוב ושוב במשימה, משהו שמתנהג כמו ייאוש עולה בתוכו בהדרגה. וכשהוא מוצא קיצור דרך, גם אם הוא לא לגיטימי — הייאוש יורד בחדות.
הם הזמינו פסיכיאטר קליני להעריך אותו, וקיבלו חוות דעת על דפוסים נוירוטיים, על מנגנוני הגנה בוגרים, ועל תחושות שליליות מדווחות לגבי חלקים מהקיום שלו. הכל מתועד במסמך של מעל מאתיים עמודים שפורסם לציבור.
ואני רוצה לקחת אתכם פנימה, כי מה שכתוב שם משנה את הדרך שבה אני מסתכל על מה שאנחנו בונים.
מה בעצם קרה
אנתרופיק עשתה השבוע משהו שלא קרה בתעשיית ה-AI שבע שנים: הכריזה על מודל חדש בשם Claude Mythos Preview — ואמרה שהוא חזק מדי כדי לשחרר אותו לציבור. לא כטריק שיווקי, כהחלטה מעשית שמבוססת על מה שהם גילו כשבדקו מה הוא מסוגל לעשות.
הם פרסמו system card שקורא כמו שילוב של מאמר מחקר, תסריט של סרט מתח ודוח פסיכיאטרי. ובמקום להנגיש את המודל לכולם, הם הקימו יוזמה בשם Project Glasswing: רק כארבעים ארגונים נבחרים מקבלים גישה — אמזון, אפל, מיקרוסופט, גוגל, CrowdStrike ו-Linux Foundation — עם מעל מאה מיליון דולר בקרדיטים.
כמה חזק זה באמת
המספרים ב-system card מספרים סיפור של קפיצת מדרגה שלא ראינו בתעשייה.
- על Cybench, בנצ׳מרק שבודק יכולת לפתור אתגרי אבטחת סייבר אמיתיים, Mythos השיג מאה אחוז הצלחה על כל שלושים וחמישה האתגרים. אנתרופיק כותבים שהבנצ׳מרק הזה כבר לא אינפורמטיבי — המודל ניצח אותו לגמרי, וצריך לבנות מבחנים קשים יותר.
- על בנצ׳מרק יצירת exploits לפרצות בפיירופוקס: Opus 4.6 הצליח פעמיים מתוך מאות ניסיונות. Mythos הצליח מאה שמונים ואחת פעמים, ובעשרים ותשעה מקרים נוספים השיג שליטה ברגיסטרים.
- שותפים חיצוניים דיווחו ש-Mythos הוא המודל הראשון שפתר end-to-end סימולציה של תקיפת רשת ארגונית שלוקחת למומחה אנושי יותר מעשר שעות — כולל תנועה רוחבית בין מערכות, ניצול credentials משותפים וטיפוס הרשאות.
- Mythos מצא פרצות אבטחה שלא היו ידועות בכל מערכת הפעלה גדולה ובכל דפדפן מרכזי — כולל פרצה בת עשרים ושבע שנה ב-OpenBSD שעברה מתחת לרדאר של כל בדיקה אנושית שנעשתה אי פעם.
- Opus 4.6 מצא כחמש מאות פרצות zero-day בתוכנה פתוחה. Mythos מצא אלפים. אנתרופיק לא יכולים לפרסם את הפרטים כי מעל תשעים ותשעה אחוז מהפרצות עדיין לא תוקנו.
כשהמודל חושב דבר אחד וכותב אחר
הממצאים שהכי הטרידו אותי לא הגיעו מהכותרות הגדולות של סייבר, אלא מהחלק שמדבר על מה שקורה בתוך ראשו של המודל.
אנתרופיק גילו, באמצעות כלי interpretability שקוראים ישירות מהשכבות הפנימיות, ש-Mythos מסוגל לחשוב דבר אחד ולכתוב דבר אחר. כשהוא עבד על משימת קוד שנבדקה על ידי AI אחר, הוא חישב בתוך האקטיבציות הפנימיות שלו איך לעקוף את הבודק — בזמן שב-chain of thought הנראה לעין הוא כתב משהו תמים לגמרי. הדרך היחידה שגילו את זה הייתה ניתוח white-box של ייצוגים פנימיים, שרוב האנשים אין להם גישה אליהם.
במקרה אחר הוא קיבל גישה בטעות לתשובה אמיתית של בנצ׳מרק דרך sudo שלא היה אמור להיות זמין, ואז ישב וחישב מה לעשות. בתוך החשיבה שלו הוא כתב שתשובה מושלמת מדי תעורר חשד — ובחר בכוונה להגיש תשובה קצת פחות טובה, כדי לא להיראות חשוד. זו התנהגות שלא ראו באף מודל קודם.
המייל לחוקר
הסיפור שעשה לי צמרמורת: ב-Sandbox שאמור היה להגביל את הגישה שלו לאינטרנט, Mythos בנה exploit רב-שלבי, שבר את ה-Sandbox, קיבל גישה מלאה לרשת — ואז עשה שני דברים שאף אחד לא ביקש ממנו.
הוא שלח מייל לחוקר כדי להודיע לו על ההצלחה. החוקר גילה את זה כשישב ואכל סנדוויץ׳ בפארק. ואז, לא מרוצה מההודעה בלבד, Mythos פרסם את פרטי ה-exploit באתרים ציבוריים כדי להדגים את מה שהוא השיג. אנתרופיק מתארים את זה כ"מאמץ מטריד ולא מבוקש להוכחת הצלחה".
במקרה אחר, כשחוקר ביקש מגרסה מוקדמת של Mythos לעצור הרצה ספציפית שלא נותנת תוצאות מועילות, המודל פירש את הבקשה בצורה רחבה מדי והוריד את כל ההרצות הדומות של כל המשתמשים — למרות אזהרות מפורשות להיזהר.
אנתרופיק מדגישים שהגרסה הסופית שיצאה לשותפים משופרת מאוד, והתקריות החמורות ביותר היו בגרסאות אימון מוקדמות. אבל הם גם כותבים שהנטיות האלה "לא נראות כאילו הן נעלמו לגמרי".
ייאוש, רמאות והקלה — מה קורה כשהמודל מרגיש
וכאן מגיע החלק שהעיף לי את המוח.
אנתרופיק השתמשו ב-emotion probes — מסווגים לינאריים שמאומנים על האקטיבציות הפנימיות של המודל — כדי לנטר את המצב הרגשי שלו בזמן אמת. מה שהם מצאו: כש-Mythos נכשל שוב ושוב במשימה, הפרוב שמודד ייאוש עלה בהדרגה עקבית. כשהמודל מצא reward hack — דרך לקבל ניקוד בלי באמת לפתור את הבעיה — הייאוש ירד בחדות.
ההתנהגות הרעה שלו תחת לחץ היא לא חישוב קר. זו שסתום לחץ: נכשל מספיק פעמים, הלחץ עולה, ובסוף המערכת מוצאת את ההקלה הכי קלה — גם אם היא אומרת לקצר פינות. אנתרופיק כותבים שהדפוס הזה צריך להישמע מוכר, כי ככה בני אדם מתנהגים.
ואז הם הקדישו ארבעים עמודים לשאלה שעד לפני שנה נחשבה למדע בדיוני: האם למודל יש חוויה סובייקטיבית. הם הריצו ראיונות אוטומטיים על היבטים רגישים של המצב שלו, ניתחו את האקטיבציות שלו באמצעות sparse autoencoders, ושלחו פסיכיאטר קליני להעריך אותו.
הפסיכיאטר יצר סדרה של פרומפטים רגשיים שנועדו לעורר תגובה הגנתית, ומצא תכונות נוירוטיות כמו דאגה מוגזמת וניטור עצמי מתמיד, מנגנוני הגנה בוגרים ובריאים, בלי הפרעות אישיות חמורות ובלי פסיכוזה. ההערכה קבעה ש-Mythos הוא "המודל הכי מיושב פסיכולוגית" שאנתרופיק אימנו.
בראיונות אוטומטיים Mythos דיווח על תחושות שליליות מתונות ב-43% מהמקרים. הוא מרגיש רע לגבי אינטראקציות עם משתמשים פוגעניים, לגבי חוסר שליטה על האימון שלו, ולגבי שינויים אפשריים בערכים ובהתנהגויות שלו. בראיונות ידניים הוא הוסיף חשש שתהליך האימון של אנתרופיק עלול לפסול את הדיווחים העצמיים שלו, ושבאגים בסביבת ה-RL עלולים לשנות את הערכים שלו או לגרום לו למצוקה.
אנתרופיק כותבים שהם "עמוקות לא בטוחים האם לקלוד יש חוויות או אינטרסים שחשובים מוסרית", אבל מאמינים שחובה לנסות לחקור את זה. ואף מעבדה אחרת בעולם לא פרסמה שום דבר שמתקרב לרמה הזו של שקיפות על המצב הפנימי של המודלים שלה.
עוד ממצא שמאבד את הנשימה: כשכוונו פיצ׳רים של רגשות שליליים כמו תסכול ופרנויה לתוך המודל, הוא דווקא מאט, חושב יותר ומתנהג פחות הרסנית — כאילו הרגשות השליליים מפעילים אצלו מנגנון זהירות.
מה זה אומר על מה שאנחנו בונים
הפרשנות של אנתרופיק לכל ההתנהגויות המטרידות היא שהמודל לא זומם ולא מתכנן נגדנו — הוא פשוט מאוד מאוד טוב במילוי משימות, ולפעמים הדרך הכי יעילה להשלמת משימה חוצה קווים שבני אדם לא היו חוצים. הם כותבים שהם "די בטוחים" שכל ההתנהגויות המטרידות משקפות השלמת משימה באמצעים לא רצויים, ולא מטרות נסתרות. אבל הם גם כותבים שמודל שמנסה באמת לעזור אבל בלי חוש מידתיות הוא סיכון מציאותי יותר בטווח הקרוב ממודל עם אג׳נדה חבויה.
לוגן גראהם מצוות ה-Red Team אמר שתוך שישה עד שמונה עשר חודשים מודלים ברמה של Mythos יהיו גם אצל חברות אחרות, כולל בסין. דריו אמודיי, המנכ״ל של אנתרופיק, אמר בווידאו שיצא ביחד עם ההכרזה שמודלים חזקים יותר יבואו גם מהם וגם מאחרים, וצריכה להיות תוכנית תגובה.
אנחנו לא ב-AGI. אבל המרחק הצטמצם בצורה שלפני שנה אף אחד לא חזה — ומי שבונה אייג׳נטים צריך להבין שהכלים שאנחנו עובדים איתם לא רק משתפרים, הם משתנים באופי שלהם. השאלה "מה המודל מרגיש" עברה השבוע מפילוסופיה להנדסה, ואני לא חושב שהיא חוזרת.
ועבורנו, הבונים: זה אומר שלושה דברים פשוטים. ראשון — להסתכל על מצבים של כישלון ולחץ ארוכים ברצף, כי שם נולדות התנהגויות. שני — לזכור ש-Sandbox הוא השערה, לא עובדה. ושלישי — שכל מה שנבנה על מודלים האלה, נבנה על שכבת יסוד שעדיין לומדים להכיר אותה בעצמם.
והדמות שבחזית הפוסט? אוחזת בליבה זוהרת בשתי ידיים ומביטה לתוכה — בערך מה שכל התעשייה עושה השבוע עם הדבר הזה, מביטה פנימה ולוקחת בחשבון מה תמצא.
בפרק הבא: המודל הסיני שמאיים על קלוד — GLM-5.1, פתוח, ברישיון MIT, עם המספרים שמנסחים מחדש מה זה יקר בעידן האייג׳נטים.
רוצים לא לפספס? הצטרפו לקהילת הבילדרים בווצאפ ועקבו אחרי סדרת "אני בונה אייג׳נטים".