Podlipodcastlejátszó Webplayer

Láncreakció

Láncreakció

#219 - Az év válsága a benchmarkok körül forog

Láncreakció · 2025. júl. 16. · 35:25

0:0035:25

Hallgasd a Podli appban 🎧

Kövesd kedvenc podcastjaidat, hallgasd őket offline és az autóban CarPlay és Android Auto segítségével, és mindig ott folytasd, ahol abbahagytad. Ingyen kipróbálhatod.

A nagy nyelvi modellek eredményességét nehéz mérni, hiszen egy meglehetősen szubjektív tevékenységet kellene összehasonlítható és objektív módon értékelni. A régebbi benchmark-adatbázisok, mint pl. az MMLU vagy a GPQA már nem jelentenek kihívást az LLM-eknek (ahogy ezt az LMArena Leaderboardján is láthatjuk), mert rájuk tanultak - de akkor mi a megoldás? Az Apple tanulmánya szerint (The Illusion of Thinking) úgysem tudnak komplex problémákat megoldani az LLM-ek, és Caiwei Chen is azt írja, hogy válságban a benchmarking (Can We Fix AI's Evaluation Crisis?). Amíg ezek vitatkoznak, mi versenyezhetünk az LLM-ekkel - ki az okosabb?

Epizódok: Láncreakció

PodliTöltsd le az ingyenes Podli appot
↓ App