Podliנגן פודקאסטים Webplayer

AI אנג׳נירינג

AI אנג׳נירינג

שרון דהן מאימפאלה - Why your LLM costs so much?

AI אנג׳נירינג · 30 בספט׳ 2026 · 45:13

0:0045:13

האזינו באפליקציית Podli 🎧

עקבו אחרי הפודקאסטים האהובים עליכם, האזינו לא מקוון וברכב עם CarPlay ו-Android Auto, ותמיד המשיכו מאיפה שהפסקתם. אפשר לנסות בחינם.

הפרק עם שרון עשה חשק לעוד? זה הזמן ללחוץ על עוקב ולדרג אותנו ב5 כוכבים.
הפרק השאיר משהו לחשוב עליו? אפשר להגיב בתגובות או או בבלינקדין שלנו
לעדכונים על מיטאפים של monday AI engineering - כאן אפשר לעקוב אחרינו ב Meetup

כולם רצים למודלים הגדולים והחזקים ביותר. אבל מה אם זו דווקא הדרך הכי יקרה — ולא בהכרח הכי טובה — לבנות מוצר AI?

בפרק הזה אנחנו מארחים את שרון דהן, Chief Architect ב getimpala.ai, ונכנסים למה שבאמת קורה מאחורי כל קריאת API ל-LLM: למה inference עולה כל כך הרבה, איך GPU ו-KV Cache משפיעים על החשבון, ולמה ניהול קונטקסט נכון יכול להיות חשוב יותר מגודל המודל.

דיברנו על איך לפרק משימות כדי לגרום למודלים קטנים לעבוד טוב יותר, איך שינוי בשאלה בלבד יכול לשפר משמעותית את התוצאות, למה מודלים סיניים משנים את כלכלת ה-AI — ומה קורה כש-Agents מתחילים לדבר אחד עם השני ומפסיקים את יום העבודה של בני האדם.

פרק על מודלים, כסף, Context Engineering והדרך לבנות AI שעובד גם בסקייל — בלי לשרוף את התקציב

פרקים: AI אנג׳נירינג

Podliהורידו את אפליקציית Podli בחינם
↓ App