AI אנג׳נירינג · 30 בספט׳ 2026 · 45:13
האזינו באפליקציית Podli 🎧
עקבו אחרי הפודקאסטים האהובים עליכם, האזינו לא מקוון וברכב עם CarPlay ו-Android Auto, ותמיד המשיכו מאיפה שהפסקתם. אפשר לנסות בחינם.
כולם רצים למודלים הגדולים והחזקים ביותר. אבל מה אם זו דווקא הדרך הכי יקרה — ולא בהכרח הכי טובה — לבנות מוצר AI?
בפרק הזה אנחנו מארחים את שרון דהן, Chief Architect ב getimpala.ai, ונכנסים למה שבאמת קורה מאחורי כל קריאת API ל-LLM: למה inference עולה כל כך הרבה, איך GPU ו-KV Cache משפיעים על החשבון, ולמה ניהול קונטקסט נכון יכול להיות חשוב יותר מגודל המודל.
דיברנו על איך לפרק משימות כדי לגרום למודלים קטנים לעבוד טוב יותר, איך שינוי בשאלה בלבד יכול לשפר משמעותית את התוצאות, למה מודלים סיניים משנים את כלכלת ה-AI — ומה קורה כש-Agents מתחילים לדבר אחד עם השני ומפסיקים את יום העבודה של בני האדם.
פרק על מודלים, כסף, Context Engineering והדרך לבנות AI שעובד גם בסקייל — בלי לשרוף את התקציב