דילוג לתוכן הראשי
חזרה לכל הפרקים
Engineeringפרק 18
פרק 18: עוד צעד משמעותי בדרך לסוף עידן הפיתוח כמו שאנחנו מכירים אותו

פרק 18: עוד צעד משמעותי בדרך לסוף עידן הפיתוח כמו שאנחנו מכירים אותו

אמלק: אסטרה מנהלת את קלוד, ואני מנהל את אסטרה.

אני משלם היום 100 דולר בחודש ל-OpenAI ו-200 דולר לאנתרופיק, ובשבועות האחרונים השתנה אצלי משהו בסיסי בדרך שבה אני עובד.

אני כבר לא מדבר עם המודל שכותב את הקוד. אני מדבר עם אסטרה, המודל של Codex שבו אני עובד, ואסטרה היא זו שמנהלת בשבילי את קלוד.

מה השתנה בלולאה

בשיטה הישנה הייתי יושב מול Cursor, מבקש שינוי, קורא מה יצא, מתקן, מבקש שוב. הייתי המנהל, המבקר והמתכנת בו זמנית, וכל משימה עברה דרכי כמה פעמים לפני שנגמרה.

בשיטה החדשה אני נותן לאסטרה משימה ברמה של "תוסיפי authentication", וזה סוף החלק שלי בלולאה. היא מבינה מה זה אומר בפרויקט הזה, מפרקת את זה לחלקים, מפעילה את Claude Code דרך ה-CLI, עוקבת אחריו, מריצה בדיקות, ומחליטה לבד אם צריך עוד סבב או שאפשר לחזור אליי.

כדי להבין עד כמה זה משנה את המשחק, צריך להבין מה היה חסר קודם. כלים כמו Claude Code ו-Cursor הביאו אותנו למצב שבו המודל כותב קוד טוב, אבל הם השאירו את הניהול אצל הבנאדם: מי מחליט מה המודל יראה, מי בודק שהוא לא שבר משהו, מי מחליט אם סיימנו — כל זה נשאר עליי.

ברגע שיש מודל שמסוגל לקחת את הניהול הזה על עצמו ולעשות אותו טוב, נעלם צוואר הבקבוק האחרון. הפעם הראשונה שנתתי משימה בבוקר, הלכתי לפגישה, וחזרתי לקוד שעבר את כל הבדיקות בלי שנגעתי בו — הייתה הרגע שבו הבנתי שהעבודה שלי השתנתה לצמיתות.

מי בנה את ה-harness

מה שהפתיע אותי הכי הרבה הוא מה קרה עם ה-harness, כלומר כל הסביבה שעוטפת את המודל ומכתיבה לו איך לעבוד. אחרי שנים שאני בונה סביבות כאלה בעצמי, לא בניתי את זו.

נתתי לאסטרה את העקרונות, והיא בנתה אותה לבד, בדיוק לצרכים של הפרויקט הזה. היא כתבה AGENTS.md שמגדיר איך עובדים כאן, CLAUDE.md שמגדיר איך Claude Code צריך להתנהג, יצרה Skills לפעולות שחוזרות על עצמן, Scripts לכל מה שאפשר לבדוק בצורה דטרמיניסטית, Hooks שאוכפים את הכללים, Task State שמתעד מה כבר נעשה, Findings שמתעדים מה למדנו בדרך, ו-Tests שמשמשים כ-evidence.

וכשהפרויקט משתנה, היא מעדכנת את זה בעצמה. הרמה שבה היא עושה את זה גבוהה ממה שראיתי אצל רוב הצוותים שעבדתי איתם.

reasoning רק במקום שצריך

העיקרון שאסטרה שומרת עליו בקנאות הוא שהמודל שכותב קוד יחשוב רק במקום שבו באמת צריך reasoning. כל השאר — Tests, Typecheck, Lint, Build, Git diff ו-Validation — רץ כסקריפט שמחזיר תשובה של כן או לא, בלי לשרוף tokens ובלי להסתמך על "נראה לי שזה בסדר".

והיא גם מקפידה שה-context יגיע just in time. במקום להגיד ל-Claude Code "הנה כל ה-repository, תבין", היא מגישה לו את המשימה, מפה קצרה וארבעה קבצים רלוונטיים. את הבחירה איזה ארבעה קבצים, היא עושה בעצמה, והיא כמעט תמיד צודקת.

הוצאתי את Cursor מהלולאה

בהתחלה ניסיתי לתת לה לעבוד דרך Computer Use: לפתוח את Cursor, לפתוח Terminal, להקליד, לחכות, לקרוא מה המסך. זה עבד, אבל כל פעולה עלתה ב-latency, ב-screenshots וב-context רק כדי להעביר מידע שאפשר להעביר ישירות דרך CLI.

אז הוצאתי את Cursor מהלולאה. הוא עדיין פתוח אצלי על אותו repository — לראות קוד, לעבוד על UI, לעשות דברים שדורשים עיניים — אבל אסטרה ו-Claude Code כבר לא עוברים דרכו.

מה אני מקבל בחזרה

והחלק שהכי שינה לי את חוויית העבודה הוא הצד שלי. מה שאני מקבל בחזרה מאסטרה הוא כבר לא קוד להסתכל עליו, אלא תוצרים: סיכום קצר של מה נעשה, מה נבדק ומה נשאר פתוח, ובמקרים של UI המסך עצמו רץ בדפדפן, כך שאני רואה את התוצאה במקום לקרוא את הקוד שיצר אותה.

ההחלטה שלי חזרה להיות החלטה של בעל מוצר — "זה מה שרציתי" או "לא, תשני את זה" — ולא של מישהו שעובר על diff שורה שורה.

הגדרת Done השתנה

בשביל שזה יעבוד, ההגדרה של Done הייתה חייבת להשתנות. אצל אסטרה משימה נחשבת גמורה רק כשהדרישה יושמה, הבדיקות עברו, typecheck ו-lint עברו, ה-build עבר כשצריך, ה-diff נבדק, אין שינויים לא מכוונים, וה-acceptance criteria אומתו.

היא לא חוזרת אליי לפני שכל זה קם, ולכן כשהיא חוזרת, זה גמור.

מה אני מודד

אחרי מספיק פרויקטים בשיטה הזאת, מה שאני מודד הוא דבר אחד: כמה זמן, כמה tokens וכמה התערבות שלי נדרשים כדי להביא משימה מ-"יש לי רעיון" ל-"יש לי קוד שעבר verification".

בכוונה אני שומר את המערכת רזה, בלי "Agent OS" עם 50 skills ו-100 hooks, כי ראיתי מספיק צוותים שבנו מפלצת ואז תחזקו אותה במקום לעבוד.

השרשרת עברה מ-Human, AI, Code ל-Human, Orchestrator, Coding Agent, Tools, Verification, Feedback — והמקום היחיד שבו אני נוגע הוא הקצה שלה.

המסקנה

השכבה הזאת — של orchestration, context, state ו-verification — הולכת להיות חשובה לא פחות מהמודל עצמו. המודלים יתחלפו כל כמה חודשים, ומי שיש לו orchestrator שיודע לבנות ולתחזק את הסביבה מסביבם, יקבל כל שדרוג בחינם, בלי לבנות שום דבר מחדש.

רוצים להמשיך עם זה? לקהילת הבילדרים בווצאפ — תכנים, כלים ודיונים מהעולם הזה.

ובסוף הסדרה: "אני בונה אייג׳נטים" נגמרת כאן — 18 פרקים על הדרך שבה אני בונה, מנהל ומפקח על מערכות AI. אם טרם קראתם מההתחלה, הסדרה כולה נמצאת כאן.