דילוג לתוכן הראשי
חזרה למדריכים
Models7 דק׳ קריאה

איך לבחור מודל למשימה: מחיר, Latency ואיכות

מסגרת החלטה פרקטית לחלוקת משימות בין מודלים גדולים וקטנים, מתי משתלם לשלם על מודל יקר, ואיך מודדים הבדל איכות בפועל ולא לפי תחושה.

שלב 0: מסווגים את המשימה לפני שמסתכלים על מודלים

שלוש שאלות לפני בחירה:

  1. איזה deadline? אינטראקטיבי — מתחת לשנייה. כמעט-אינטראקטיבי — מתחת לחמש. רגע — לא אכפת. התשובה מסננת את השדה לפני שמשווים בכלל.
  2. מה דרישת האיכות האמיתית? סיווג intent מול ניתוח משפטי — שתי בעיות שונות לגמרי. "שיהיה הכי טוב" זו לא דרישה.
  3. מה אופי הכשל? טעות בסיווג עולה כמה טוקנים נוספים. טעות בהמלצת תרופה עולה בבית משפט.

המפה של 2026 בקצרה

השוק התייצב על שלוש שכבות שחוזרות אצל כל ספק: מודל דגל עם reasoning במחיר של כמה דולרים עד עשרה דולר למיליון טוקני קלט (ופי כמה על פלט), שכבת ביניים שזולה בסדר גודל, ושכבת "ננו" שעולה אגורות. הפערים בין השכבות: פקטור של 10–100 במחיר, פקטור של 2–5 באיכות למשימות קשות, וכמעט אפס הבדל למשימות פשוטות.

לכן הכלל החשוב ביותר: מחיר לטוקן זה מדד מטעה. מודדים עלות למשימה שהושלמה. מודל זול שצריך שלוש קריאות תיקון ולולאה של retries יקר יותר ממודל דגל שסוגר בקריאה אחת. ומודל שזול לטוקן אבל צריך prompt ענק — לא זול למשימה.

תהליך הבחירה, שלב אחר שלב

  1. בונים סט הערכה קטן — 50 עד 200 קלטים אמיתיים מהעולם שלכם, עם תשובות נכונות ידועות. לא סינתטי, לא "נראה סבבה". מה שלא נמדד על הדאטה שלכם — לא נמדד.
  2. מריצים 3–5 מודלים משכבות שונות על אותו הסט. מודדים שלושה דברים: שיעור הצלחה, עלות למשימה, latency (TTFT + מהירות יצירה).
  3. מסננים לפי הסדר הזה: compliance קודם (מיקום דאטה, רגולציה), אחר כך latency, בין השורדים משווים עלות למשימה, ואיכות שוברת שוויון.
  4. מיישמים routing — המנצח הוא לא מודל אחד אלא שניים: fast lane לאינטראקציות (מותאם TTFT, תשובות קצרות, cap על output tokens, streaming) ו-deep lane לניתוח וסינתזה מורכבת. ההחלטה יכולה להיות rule-based פשוט — לפי סוג ה-endpoint או סיווג מוקדם של הבקשה — וזה מספיק לרוב המקרים.

איך יודעים שמודל "יותר טוב" באמת

לא לפי vibes ולא לפי leaderboard. Leaderboards נשברים על הדאטה שלכם — מודל שמקדים ב-benchmark כללי מפספס דווקא את הדיאלקט הספציפי של המשתמשים שלכם. המדד היחיד שמשנה: שיעור הצלחה על סט ההערכה שלכם, עם קריטריון binary — עבר/נכשל, שמוגדר מראש לפני שרצים.

טעויות נפוצות

  • לשלם על מודל דגל להכל — בדיקת שם קובץ לא צריכה reasoning. זה בזבוז שמצטבר.
  • לחסוך על המודל הלא נכון — חיתוך עלות במקום שבו הכישלון יקר.
  • לשכוח את טוקני הפלט — פלט תמיד יקר יותר מקלט, פי 3–5. מודל שמרבה לדבר עולה יותר ממה שנדמה.
  • להתעלם מ-reasoning tokens — אצל מודלים עם thinking, הטוקנים הפנימיים מחויבים כפלט ויכולים להכפיל את עלות הקריאה.

רוצה להעמיק את הנושא אצלך בצוות?

סדנאות מעשיות והרצאות שמבוססות על הניסויים מהשטח — כולל קוד חי ותרגול.

בואו נדבר