Suivez vos podcasts préférés, écoutez hors ligne et en voiture avec CarPlay et Android Auto, et reprenez toujours là où vous en étiez. Essai gratuit.
Merci de soutenir ce podcast en visitant nos sponsors: - KrispCall: Téléphonie cloud agentique - https://try.krispcall.com/tad - Consensus: IA pour la recherche. Obtenez un mois gratuit - https://get.consensus.app/automated_daily - Investissez comme les professionnels avec StockMVP - https://www.stock-mvp.com/?via=ron Soutenez directement The Automated Daily: Offre-moi un café: https://buymeacoffee.com/theautomateddaily Sujets du jour: Auto-amélioration récursive des modèles - OpenAI met en avant la recursive self-improvement, tandis que Dream-RSI et Never Give Up cherchent à mieux explorer et à concentrer le compute sur les tâches difficiles. Mots-clés: OpenAI, Noam Brown, RL, agents, benchmarks. Fiabilité réelle des agents - Le nouveau cadre Pass^k montre qu’un agent peut afficher une bonne moyenne tout en restant instable d’un essai à l’autre. Enjeu clé pour l’automatisation, le code et les workflows en entreprise. Fraîcheur cachée des LLM - Une comparaison entre date de sortie et cutoff d’entraînement rappelle qu’un modèle récent n’est pas forcément à jour. Utile pour vérifier versions, dates, actualité et recherche web. Payer le web au crawl - Un test avec x402 fait payer un centime par page aux agents IA, pendant que Google expérimente la rémunération des éditeurs pour les réponses IA. Le débat porte sur la monétisation du contenu et la traçabilité des paiements. IA récursive pour matériaux - Au MIT, un système IA a créé son propre monde de recherche pour étudier la rupture de métamatériaux et en extraire des principes de conception. Un signal fort pour l’AI for science et la science des matériaux. Microsoft met en garde - Mustafa Suleyman avertit contre l’anthropomorphisme des modèles et rappelle qu’ils ne sont pas conscients. Le sujet touche la sécurité, la gouvernance et le vocabulaire de l’industrie AI. Hype, rejet et tri du marché - Entre le cimetière des produits IA et la controverse d’un menu ChatGPT dans un café, le marché envoie le même message: utilité réelle et confiance priment sur la nouveauté. Mots-clés: AI graveyard, adoption, backlash, créateurs. - TypeSafe AI Launches System One Models and Jev - Odyssey Unveils Odyssey-3, a General-Purpose Physical Intelligence Model - Databricks Explains How Genie Pushes Data Agents Forward - Coffee Shop Owner Faces Backlash Over AI-Made Menu Poster - Google Launches Gemini Audio Models for Real-Time Voice Apps - How Stale Is Your AI? - OpenAI’s Priority Is Recursive Self-Improvement - IBM Research: Measuring and Reducing Agent Consistency Gaps - Periodic Labs Says Its New Neon Model Improves Scientific XRD Analysis - AI System Finds Design Rules for Damage-Resistant Metamaterials - Charging AI Agents a Penny Per Page - Ory Launches Agent Security for AI Coding Agents - Microsoft AI Chief Warns Against Humanizing AI - AIUC Raises $40M to Audit and Certify AI Agents - Thread Claims AI Safety Is Driven by Cult-Like Rationalist Culture ([skywriter.blue](https://skywriter.blue/%40segyges.bsky.social/3mvom4b4dn22q)) - TechCrunch’s AI Graveyard Tracks the Industry’s Failed Bets - Meta Launches Meta One Subscription With Expanded AI and Creator Tools - G5 Labs Raises $14M Seed to Rebuild Software Development Around Natural Language - OpenArm: Open-Source Humanoid Arm for Physical AI Research - Never Give Up: An RL Method to Reduce the Matthew Effect in LLM Training - OpenSpec: A Lightweight Framework for Software Specifications - Dream-RSI Proposes a Low-Cost Loop for Recursive AI Self-Improvement Transcription de l'Episode Auto-amélioration récursive des modèles On commence par l’axe le plus stratégique du moment. Dans un nouveau développement de l’histoire que nous suivions déjà, Noam Brown explique qu’OpenAI place l’auto-amélioration récursive tout en haut de sa feuille de route: des modèles qui aident à concevoir de meilleurs modèles. Et ce n’est pas un cas isolé. D’autres travaux publiés en parallèle vont dans la même direction, avec des approches qui cherchent à mieux explorer les pistes prometteuses et à réserver davantage de calcul aux problèmes vraiment difficiles. Ce qui compte ici, c’est moins un produit de plus qu’un possible changement de rythme dans le progrès des modèles. Fiabilité réelle des agents Autre point important: la différence entre capacité et fiabilité. Une nouvelle analyse sur les agents montre qu’un bon score moyen peut masquer un problème très concret: le même système peut réussir une tâche une fois, puis échouer la suivante dans des conditions presque identiques. Les auteurs proposent donc une nouvelle manière de mesurer la constance, pas seulement la performance brute. C’est essentiel, parce qu’en production, surtout pour l’automatisation ou le code, ce qu’on attend d’un agent n’est pas un exploit occasionnel, mais un comportement stable. Fraîcheur cachée des LLM Dans le même registre, un rappel très utile circule aujourd’hui sur la fraîcheur réelle des modèles. L’idée est simple: il faut distinguer la date de sortie d’un modèle et la date à laquelle ses données d’entraînement s’arrêtent. Un modèle peut donc être tout neuf commercialement, tout en restant en retard de plusieurs mois sur certains faits. Pour les utilisateurs comme pour les agents, la leçon est claire: si une date, une version ou un événement récent compte, il faut vérifier avec une source externe plutôt que de supposer que le modèle est à jour. Payer le web au crawl Côté économie du web, une expérience attire l’attention. Un auteur a configuré son site pour faire payer un centime par page aux agents IA via le protocole x402, puis a montré qu’un agent pouvait effectivement payer et récupérer le contenu. En parallèle, Google teste aussi une autre logique, où certains éditeurs sont rémunérés quand leur contenu contribue à une réponse générée par IA, mais avec un calcul beaucoup moins transparent. Pourquoi c’est intéressant? Parce que le débat ne porte plus seulement sur le trafic ou l’indexation, mais sur la façon dont le web peut être rémunéré