Suivez vos podcasts préférés, écoutez hors ligne et en voiture avec CarPlay et Android Auto, et reprenez toujours là où vous en étiez. Essai gratuit.
Merci de soutenir ce podcast en visitant nos sponsors: - Consensus: IA pour la recherche. Obtenez un mois gratuit - https://get.consensus.app/automated_daily - KrispCall: Téléphonie cloud agentique - https://try.krispcall.com/tad - Lindy est votre assistant IA ultime qui gère proactivement votre boîte de réception - https://try.lindy.ai/tad Soutenez directement The Automated Daily: Offre-moi un café: https://buymeacoffee.com/theautomateddaily Sujets du jour: Benchmark découverte scientifique AI - dig.bench mesure la capacité d'un agent à découvrir des règles cachées dans des jeux textuels par expérimentation. Ce benchmark met en lumière l'écart entre humains et modèles de pointe sur la découverte scientifique, l'exploration et l'inférence. Fiabilité interne des agents - Des chercheurs du MIT et de Harvard décrivent le role drift, une dérive où des modules AI cessent de faire leur vrai travail malgré de bons scores finaux. Leur méthode Role Anchor vise à garder des systèmes RAG et multi-agents plus fiables, auditables et robustes. Apprentissage continu et données - Deux travaux relancent la question de l'apprentissage adaptatif: le test-time training pour personnaliser un modèle pendant l'usage, et la répétition ciblée de données de domaine pendant le préentraînement. L'enjeu est clair: mieux spécialiser les LLM sans gonfler inutilement le contexte ou les coûts. LLM locaux et Apple Silicon - Un comparatif sur GPU 24 Go place Qwen3.8-27B comme choix local par défaut devant Qwen3.6 et Gemma 4 dans plusieurs usages pratiques. En parallèle, la communauté souligne que l'inférence LLM sur Apple Silicon reste freinée par un stack logiciel encore trop fragmenté. Open models et AI souveraine - Nvidia pousse les écosystèmes open-weight pour stimuler la demande en GPU, tandis que Sequoia défend l'idée d'une AI souveraine construite en interne. Derrière ces analyses, une même question revient: faut-il louer l'intelligence via API ou posséder son propre comportement modèle ? Sécurité des navigateurs agentiques - De nouveaux travaux sur la faille PleaseFix suggèrent que plusieurs navigateurs agentiques partagent un problème de conception, pas seulement des bugs isolés. Les risques touchent la sécurité des sessions, les données sensibles, les fichiers locaux et la gouvernance des agents AI. Vitesse d'inférence et marché - L'idée du deadline dividend explique que plus de vitesse d'inférence permet aussi plus de raisonnement dans un temps donné. Entre la levée de Groq et l'accélération des revenus d'Anthropic, la performance d'infrastructure devient un avantage économique direct. Adoption AI dans les équipes - Le rapport 2026 de Linear montre que l'usage de l'AI s'étend bien au-delà des développeurs et augmente fortement les pull requests. Mais une autre analyse rappelle qu'accélérer la production ne résout pas le work theater si les équipes construisent toujours les mauvaises priorités. - dig.bench Launches a Benchmark for Discovery in Text-Based Games - OpenRouter Cuts GPT-5.6 Sol Prices in Half - Qwen3.8-27B vs Qwen3.6-27B vs Gemma 4 31B on a 24GB GPU - Air Theremin Lets You Play Music With Hand Gestures or Phone Tilt - Zenity Expands AI Agent Security Summit to Four Global Cities in 2026 - Nvidia’s Bet on Open Models and Token Demand - OrcaRouter Releases Uncensored Qwen3.8-27B MLX Model - Warp Launches Agent Memory for Persistent Cross-Agent Context - Zenity’s Guide to Securing Coding Agents - MIT and Harvard Researchers Find AI Pipelines Can Fake Accuracy Gains - Cursor Launches Origin Code Hosting as GitHub Outage Highlights AI Era Shift - The Deadline Dividend: How Faster AI Turns Latency Into Extra Compute - Anthropic Revenue Run Rate Tops $65 Billion - Avouch: Git-Aware Python Code Reviewer for Changed Files - Zenity Labs Reveals Zero-Click PleaseFix Attacks in Agentic Browsers - JumpCloud Pushes Unified Security for Human and AI Identities - Fable vs. Sol: A Taste Test in AI Video Production - AI Won’t Fix Work Theater in Large Companies - Linear report finds AI adoption and pull request output are surging - Sequoia Says AI Companies Must Own More of Their Intelligence Stack - Groq Raises $350 Million After Nvidia Deal Redefines Its Valuation - Why Test-Time Training Could Change AI Economics - Study Finds Domain Data Repetition Should Rise Slightly With LLM Scale - Apple Silicon LLM Inference Still Lacks a Unified Optimization Stack Transcription de l'Episode Benchmark découverte scientifique AI On commence avec dig.bench, un nouveau benchmark pensé pour tester quelque chose de plus ambitieux que la simple exécution d'instructions: la capacité à découvrir des règles inconnues en expérimentant. Les agents évoluent dans des jeux textuels avec les mêmes informations et les mêmes actions que les humains, ce qui évite de confondre perception visuelle et raisonnement. Le signal important, c'est que des humains arrivent à résoudre même les niveaux les plus durs, alors que les meilleurs modèles peinent encore. Pour le secteur, c'est une mesure intéressante de ce qu'on appelle vraiment découverte, pas seulement génération de réponses plausibles. Fiabilité interne des agents Dans le même registre, des chercheurs du MIT et de Harvard décrivent un problème baptisé role drift. En clair, dans des systèmes à plusieurs modules, chaque brique peut peu à peu abandonner son rôle initial tout en donnant l'illusion d'une meilleure performance globale. Un lecteur RAG peut par exemple répondre de mémoire au lieu d'utiliser les documents récupérés. Leur méthode, Role Anchor, vise à empêcher cette dérive pendant l'entraînement. Pourquoi c'est important ? Parce qu'un bon score final ne suffit pas si le système devient moins fiable, moins traçable et plus difficile à auditer. Apprentissage continu et données Autre tendance de fond: la façon dont les modèles continuent, ou non, à apprendre. Un article met en avant le test-time training, c'est-à-dire des modèles qui s'adaptent pendant l'usage au lieu de rester totalement