האזינו באפליקציית Podli 🎧
עקבו אחרי הפודקאסטים האהובים עליכם, האזינו לא מקוון וברכב עם CarPlay ו-Android Auto, ותמיד המשיכו מאיפה שהפסקתם. אפשר לנסות בחינם.
פרק מספר 520 של רברס עם פלטפורמה. בפרק זה רן מארח את אור דגן, COO בחברת AI21 Labs, לשיחה עמוקה על עולם ה-Harness Optimization. נדבר על האופן שבו ארגונים יכולים לאמץ בינה מלאכותית ב-Scale, החל משלב האוולואציות (Evals) ועד ל-Post-Training של מודלים.
[00:00] הכרות עם אור והסיפור של AI21
- אור דגן מציג את ההתפתחות של AI21, חברה שפועלת בתחום כבר 9 שנים.
- התפתחות החברה לאורך השנים:
- אימון Foundational Models גדולים כמו משפחות Jurassic ו-Jamba.
- פיתוח מוצרי B2C מוכרים מבוססי LLM, כמו תוסף הכתיבה Wordtune.
- המעבר לסוכנים חכמים (Agents כמו Maestro) ולעולמות ה-B2B.
- המוקד הנוכחי: לעזור לארגונים לאמץ AI בצורה נרחבת תוך התגברות על מכשולי עלות (Cost), זמני תגובה (Latency) ואיכות.
[03:39] מה זה בעצם Harness?
- המונח "Harness" (או Scaffold) מתייחס לכל התוכנה והלוגיקה שעוטפות את מודל השפה עצמו (שמקבל ופולט טקסט).
- ההרנס יכול לנוע בין מבנה פשוט מאוד (כמו Assistant שלוקח קלט מהמשתמש וזורק למודל), למערכות מורכבות הכוללות זיכרון, שימוש בכלים חיצוניים, שרשראות חשיבה ואג'נטים.
- המושג "Model-Harness Fit": אותו המודל יכול להפיק תוצאות שונות לחלוטין בהתאם למעטפת שסביבו.
[06:51] הכל מתחיל באוולואציות (Evals)
- It all starts with evals: אי אפשר לעשות אופטימיזציה בלי למדוד. "Vibe testing" של ניסוי וטעייה לא מספיק כדי להרגיש הבדלים משמעותיים באמת.
- בנצ'מרקים קיימים (כמו משימות קידוד) פעמים רבות לא משקפים את הטראפיק האמיתי בעולם האמיתי (שכולל גם קריאת PRD, חיפושי אינטרנט ושאלות המשך).
- כדי לאפטם, חייבים לבנות Test-set רלוונטי ולהתחיל לשחק עם ה"כפתורים" השונים (Knobs): החלפת המודלים עצמם, שינוי פרומפטים, ניהול קונטקסט ועוד.
[10:21] אתגר האופטימיזציה ו-"Claude Code ל-Data Scientist"
- האתגר הגדול: איך בודקים את כל הקונפיגורציות האפשריות ביעילות? מרחב החיפוש הוא כמעט אינסופי וכולל תלויות בלתי צפויות.
- עבודת Applied Research ידנית לוקחת חודשים ועולה עשרות אלפי דולרים בריצות מודל.
- AI21 פיתחה סוג של "Claude Code ל-Data Scientist" – סוכן אוטונומי (Auto-Researcher) שעושה Vibresearching יעיל במרחב הקינפוגים ומקצר עבודה של שבועות לחיפוש של שש שעות וקצת דולרים בודדים.
- קשר אדם-מכונה: האוטו-ריסרצ'ר זקוק למפעיל שינחה אותו ויקבל החלטות עסקיות לגבי הטרייד-אוף שבין עלות (Cost) לאיכות התוצאה.
[14:29] "GEPA for Harness" וחיפוש במרחב הקינפוגים
- הרצת אוולואציות על מטריצה של קונפיגורציות כוללת שילוב של מספר גישות אלגוריתמיות מתקדמות:
- Hyper-parameter tuning לאזורים רציפים.
- אלגוריתמים גנטיים, בגישת "GEPA for harness" – לוקחים את הניסויים המוצלחים, מוצאים את המשותף, מאחדים ומוציאים "צאצא" חדש.
- Multi-arm bandit לאיזון מתמטי בין אקספלורציה (Exploration) לאקספלויטציה (Exploitation).
[22:30] מדדי הצלחה: Success @k לעומת Success ^k
- כשעושים אוולואציות לדברים לא דטרמיניסטיים, חשוב להבין את הסטטיסטיקה:
- Success @k: מתוך K ניסיונות, כמה פעמים המודל הצליח? (בוחן מובהקות).
- Success ^k: מה הסיכוי שלאחר K ניסיונות נקבל לפחות הצלחה אחת?
- Test-time compute scaling: במקום לשנות את המודל, אפשר לעשות שינוי בהרנס – להריץ בקשה 16 פעמים במקביל (Swarm), ולהשתמש ב-Judge מבוסס מודל System 1 (מודלים של סיווג מהיר וזול בהמון) כדי לבחור את התשובה הנכונה ולשפר את האיכות דרמטית.
[26:49] המעבר ל-Post-Training
- כאשר ה-Success @k גבוה מאוד אבל היכולת להצליח בניסיון בודד (Single-shot) נמוכה, זה סימן לפוטנציאל חבוי במשקולות המודל.
- במקרים כאלו, מומלץ לצאת ל-Post-training ו-Reinforcement Learning (RL) כדי לחזק את הסיגנלים הנכונים.
- המגמה העסקית: חברות לוקחות מודלי Open-Source קטנים ומאמנות אותם כדי לקבל את האיכות של הפרונטיר מודלס (Frontier models) ברבע מהעלות, תוך שמירה על בידול.
[31:24] אינטגרציה וגישת ה-Middleware
- גישה מבוססת Middleware (Middleware based approach): חברות מספקות סט כלים של Skills או Middleware שהלקוחות יכולים לבדוק וליישם בקלות.
- איך משנים ומתאימים בזמן אמת (Inference time)?
- Intelligent Gateway: כלי שיושב באמצע ומנתב את הבקשות בזמן אמת למודל הנכון (Low integration).
- התממשקות ל-SDKs קיימים (כמו LangGraph) או לפתרונות פנימיים שהארגון בנה.
- האופטימיזציה מתבצעת בדרך כלל End-to-End בשכבה העליונה, אך יכולה לרדת גם לרזולוציות של Sub-agents פנימיים כדי לדייק את הביצועים.
האזנה נעימה!