
פרק 12: המודל הסיני שמאיים על קלוד, והוא בחינם
אני רוצה לדבר היום על משהו שנוגע ישירות לכיס ולעבודה היומית של כל מי שבונה אייג׳נטים.
בשבוע שעבר מודל סיני בשם GLM-5.1 יצא כ-open source ברישיון MIT, הגיע למקום הראשון בעולם על SWE-Bench Pro — אחד הבנצ׳מרקים הכי מכובדים לקוד — והשיג 94.6% מהביצועים של Claude Opus 4.6 במשימות פיתוח.
לפני שנתיים מודלים פתוחים היו שנתיים מאחורי המודלים הסגורים. לפני שנה הפער ירד לשישה חודשים. והשבוע מודל פתוח הכתיר את עצמו למקום הראשון בעולם בקוד. הפער בפועל כמעט נסגר.
למה זה רלוונטי אלינו
מי שבונה אייג׳נטים היום יודע שהעלות של מודלים היא שורה משמעותית בטבלת ההוצאות.
Claude Opus 4.6 עולה חמישה עשר דולר למיליון טוקנים בקלט ושבעים וחמישה בפלט, GPT-5.4 בסדר גודל דומה — וכשאתם מפתחים מערכת שעוברת עשרות איטרציות ביום, עם שיחות ארוכות ואייג׳נטים שקוראים קבצים ומריצים פקודות, העלות מצטברת מהר.
GLM-5.1 מתומחר ב-1.40 דולר למיליון טוקנים בקלט ו-4.40 בפלט. זה פער של סדר גודל שלם מול המודלים המובילים, וביצועים שנמצאים בטווח של חמישה אחוזים מהם.
מה שמעניין במודל הזה הוא לא רק המחיר אלא מה שהוא מסוגל לעשות עם זמן. מודלים קודמים, כולל GLM-5, נוטים למצות את ארגז הכלים שלהם מהר — הם מנסים כמה גישות מוכרות ואז נתקעים.
GLM-5.1 בנוי אחרת. הוא נשאר אפקטיבי על משימות אייג׳נטיות לאורך סשנים ארוכים הרבה יותר, מפרק בעיות מורכבות לחלקים, מריץ ניסויים, קורא תוצאות ומזהה חסימות בצורה מדויקת. Z.ai, החברה שפיתחה אותו, טוענים שהוא יכול להחזיק יום עבודה שלם של פיתוח בלי שהאיכות תרד — וזו טענה שלא שמעתי על שום מודל אחר.
המספרים שמאחורי הקלעים
GLM-5.1 בנוי על ארכיטקטורת Mixture of Experts עם 744 מיליארד פרמטרים, שמתוכם רק ארבעים מיליארד פעילים בכל רגע נתון — מה שמאפשר ביצועים ברמה גבוהה בעלות נמוכה יחסית. חלון ההקשר הוא מאתיים אלף טוקנים, ויכולת הפלט מגיעה ל-131 אלף טוקנים בתגובה אחת — מה שאומר שהוא יכול להחזיק פרויקט שלם בראש ולייצר קבצים ארוכים ומורכבים בבת אחת.
הוא אומן על שבבי Huawei Ascend בלי שום שבב של NVIDIA, מה שהופך אותו לאבן דרך מבחינת העצמאות הטכנולוגית של סין.
על SWE-Bench Pro הוא הגיע ל-58.4, מעל GPT-5.4 שהגיע ל-57.7 ומעל Claude Opus 4.6 שהגיע ל-57.3. על הערכת הקוד של Claude Code עצמו הוא קיבל 45.3 נקודות מול 47.9 של Opus. הקפיצה מ-GLM-5 ל-GLM-5.1 הייתה שיפור של עשרים ושמונה אחוז, שהגיע כולו מאופטימיזציה של post-training: אותו מודל בסיס, אותה ארכיטקטורה, אותו מספר פרמטרים — רק אימון מחדש טוב יותר.
זה אומר שהגל הבא של שיפורים ב-AI לא בהכרח יגיע ממודלים יותר גדולים, אלא מטכניקות אימון יותר חכמות.
הזירה: סין מול המערב
כדי להבין למה ההשקה הזו משנה, צריך לשים את המספרים של GLM-5.1 בקונטקסט רחב יותר.
הדפוס שחוזר על עצמו בשנתיים האחרונות הוא קבוע: מודלים סיניים מגיעים, נופלים קצת אחרי החזית, ואז סוגרים את הפער מהר — מהר יותר מקודמיהם. DeepSeek הייתה נקודת הציון שהמערב התעורר ממנה: מודל פתוח עם ביצועים קרובים לחזית, במחיר שערער את ההנחות של כולם. אחרי זה באו Qwen של עליבאבא — שכיום נחשב לאחד מהמודלים הפתוחים הנפוצים בעולם — Kimi, MiniMax, ועכשיו GLM של Z.ai. כל אחת מהחברות האלה מוציאה גרסה חזקה יותר מקודמתה בקצב שהמערב התקשה לעמוד בו.
יש לכך סיבה מבנית אחת גדולה: אמברגו השבבים שכפה המערב על סין דחף אותה לפתח תשתית עצמאית. Huawei Ascend — עליו אומן GLM-5.1 — הוא התוצר הישיר של הלחץ הזה. במקום לחסום את ההתקדמות, האמברגו האיץ אותה. זה לקח שלמדנו בדרך הקשה.
ובצד הכלכלי: המודלים הסיניים מתחרים על מחיר, והמערביים מתחרים על יכולת וסגירות. רישיון MIT על GLM-5.1 אומר שאתם יכולים להריץ אותו בעצמכם, להלבין אותו, ולשנות אותו — בלי תלות בספק. למי שבונה מערכת עם עשרות איטרציות ביום, זו לא רק חיסכון, זו אפשרות אדריכלית חדשה.
בצד המערבי, OpenAI, Anthropic ו-Google נותרו סגורים עם שחרורים זהירים — ראינו את זה לפני שבועיים, כש-Anthropic החליטה לא לשחרר את Claude Mythos מרוב עוצמה. גם אסטרטגיית ה-open של Meta זזה הצידה, ו-Mistral האירופית ממשיכה להוות אלטרנטיבה מכובדת. בקיצור: החזית הסגורה עדיין מערבית, אבל הפתוחה כבר לא אחורנית — היא באותו סדר גודל.
מה זה אומר בפועל
אני לא אומר לוותר על קלוד. אני משתמש בו כל יום, והוא עדיין המודל הכי טוב לדברים שדורשים חשיבה עמוקה וניואנסים. אבל לרכיבים מסוימים בתוך מערכת אייג׳נטית — במיוחד כאלה שדורשים נפח גבוה של קריאות, או סשנים ארוכים של קוד — GLM-5.1 הוא אופציה שצריך להכיר.
והמהלך החכם כרגע הוא לא בחירה אלא חלוקה: קלוד לחשיבה, מודל פתוח לנפח. לשלוח את מה שעולה דולר למשימה שעולה סנט, ולשמור את הכסף הכבד למקומות שבהם ההבדל באמת מורגש.
מה שאנחנו רואים כאן הוא מגמה שתמשיך להאיץ: מודלים פתוחים שמתקרבים לביצועים של המודלים הסגורים, במחיר שמאפשר לבילדרים קטנים ובינוניים לבנות מוצרים שעד אתמול דרשו תקציב של חברה גדולה.
והדמות שבחזית הפוסט מחזיקה ביד ליבה זוהרת שעליה רשום GLM-5.1 — בדיוק הרעיון: הדבר הקטן והזול שמחזיק עכשיו הרבה כוח, ואם יודעים לאן לחבר אותו, הוא מריץ את כל המערכת.
בפרק הבא: מה עושים לפני שורת הקוד הראשונה. שבעה צעדים, מהכלים שאספתי אחרי מאות שעות — PRD, CLAUDE.md, אילוצים שליליים וטסטים לפני פיתוח.
רוצים לא לפספס? הצטרפו לקהילת הבילדרים בווצאפ ועקבו אחרי סדרת "אני בונה אייג׳נטים".