Podliподкаст-плеер Webplayer

Research Insights Made Simple

Research Insights Made Simple

Разбираем построение работающих evals

Research Insights Made Simple · 31 июл. 2026 г. · 59:52

0:0059:52

Слушайте в приложении Podli 🎧

Подписывайтесь на любимые подкасты, слушайте офлайн и в машине с CarPlay и Android Auto и всегда продолжайте с того места, где остановились. Попробуйте бесплатно.

Как понять, что AI-агент действительно готов к production? Красивый ответ и даже высокий "pass rate" показывают только финал одного запуска. Агент мог подсмотреть решение, выбрать опасный путь, нарушить права или рассыпаться при повторном прогоне.

Обсудили это вместе с Евгением Сергеевым - Engineering Director в Flow Health с двадцатилетним опытом разработки и управления инженерными командами. Мы разбирали как превратить evals из разовой проверки ответа в воспроизводимую инженерную систему.

Минимальная единица такой системы - воспроизводимый эпизод (`replayable episode`): замороженное исходное состояние, входные данные, контракт агента, скрытая проверка, трасса действий и критерий выпуска. Для кода это может быть commit до PR и `hidden tests`; для архитектуры - требования, ограничения и проверка исполнимости решения; для data platform - snapshot данных, lineage и инварианты.

Обсудили

Для меня главный вывод такой: устойчивое качество создаёт не одна метрика и не конкретная модель. Нужен собственный каталог реальных задач, воспроизводимые проверки и понятный критерий, после которого новой версии агента действительно можно доверить работу.

Выпуски: Research Insights Made Simple

PodliСкачай бесплатное приложение Podli
↓ App