Suivez vos podcasts préférés, écoutez hors ligne et en voiture avec CarPlay et Android Auto, et reprenez toujours là où vous en étiez. Essai gratuit.
Merci de soutenir ce podcast en visitant nos sponsors: - KrispCall: Téléphonie cloud agentique - https://try.krispcall.com/tad - Investissez comme les professionnels avec StockMVP - https://www.stock-mvp.com/?via=ron - Prezi: Créez rapidement des présentations avec l'IA - https://try.prezi.com/automated_daily Soutenez directement The Automated Daily: Offre-moi un café: https://buymeacoffee.com/theautomateddaily Sujets du jour: Mémoire longue: OpenAI vs Anthropic - Comparaison OpenAI vs Anthropic sur la gestion des tâches longues: compaction côté serveur contre architecture multi-agents, avec enjeux de cohérence et de coût. Accélération GPU et attention sparse - MiniMax Sparse Attention apporte des kernels d’attention dense et sparse optimisés pour GPU NVIDIA nouvelle génération, clé pour long contexte et efficacité. Coût d’inférence et KV-cache - Une méthode de “napkin math” relie bande passante mémoire, KV-cache et batching: pourquoi le long contexte coûte surtout en VRAM, et comment PagedAttention change l’équation. GitHub sous tension, multi-cloud - Microsoft ajoute de la capacité chez AWS pour absorber le boom du “agentic coding” sur GitHub, signe que la demande dépasse les plans Azure et que la fiabilité devient stratégique. Contrôles à l’export: Anthropic bloqué - Directive américaine: Anthropic suspend Fable 5 et Mythos 5 pour les ressortissants étrangers, débat sur transparence, sécurité et précédent réglementaire. Europe: entraîner un modèle souverain - Le projet euromesh propose de fédérer le calcul public européen (EuroHPC, AI Factories) pour entraîner un modèle d’ici 2028, malgré contraintes politiques et opérationnelles. Agents, routage et réseaux de modèles - Des billets soutiennent que des ensembles et routeurs de modèles peuvent dépasser un modèle unique: impact sur stratégie, contrôle du “frontier” et résilience face aux restrictions. Siri plateforme: choix de modèles - iOS 27 bêta évoque un framework permettant à Siri de basculer entre ChatGPT, Claude ou Gemini: Siri deviendrait une couche de routage, avec enjeux DMA et partenariats. Qualité du code IA en production - Le rapport New Relic 2026 souligne un écart entre code IA jugé bon en revue et incidents en prod, renforçant l’importance tests, gouvernance et observabilité. Outils open source: eval et agents - AllenAI olmo-eval vise l’évaluation continue de checkpoints; Strands Agents propose un SDK d’agents avec hooks et garde-fous: l’industrialisation passe par l’outillage. - OpenAI vs Anthropic: Compaction vs Sub-Agent Delegation for Long-Context Work - MiniMax open-sources MSA sparse attention and FlashAttention kernels for NVIDIA SM100 - Report Claims Europe Could Train a Frontier AI Model by Federating Existing Public Supercomputers - New Relic report finds AI-generated code boosts speed but raises production incidents - Homelab GitOps Platform Uses OpenCode AI Behind PR Review and Network Isolation - Napkin Math for Estimating LLM Inference Cost per User at Scale - Ramp Labs Announces Private, Production-Based Coding Benchmark Ramp SWE-Bench - Microsoft Turns to AWS to Shore Up GitHub Amid AI-Driven Capacity Crunch - Atlassian webinar highlights gap between AI productivity hype and measurable developer gains - Moonshot AI Releases Kimi K2.7 Code, Claiming Stronger Long-Horizon Coding and Lower Reasoning Cost - X Post Claims DeepSeek’s Endgame Is an AI Hardware Ecosystem, Not App Revenues - US Export-Control Order Forces Anthropic to Suspend Fable 5 and Mythos 5 Access - Z.ai releases GLM-5.2 to coding plan users, promises MIT open-source launch next week - NVIDIA Blackwell Tops First AgentPerf Benchmark for Agentic AI Workloads - Essay Claims Model Ensembles Are Overtaking Single Frontier AI Systems - Count Anything Introduces CLOC and a Text-Guided Cross-Domain Object Counting Model - Google tests a Skills Marketplace and Android Studio integration in Gemini Business - Strands Agents releases open-source Python and TypeScript SDK for controllable AI agents - Google Cloud launches Open Knowledge Format to standardize AI-ready knowledge sharing - iOS 27 Beta Hints at Third-Party AI ‘Extensions’ for Siri That Apple Didn’t Announce at WWDC - AllenAI Releases olmo-eval to Streamline Reproducible LLM Evaluation Across Checkpoints Transcription de l'Episode Mémoire longue: OpenAI vs Anthropic On commence par une lecture assez éclairante sur la “mémoire” des assistants IA quand les tâches s’étirent sur des heures, voire des jours. L’article oppose deux styles. Côté OpenAI, l’idée serait de conserver un seul grand fil de conversation, mais de le “compacter” régulièrement côté serveur: on résume, on élague, on garde ce qui compte, puis on continue. L’auteur insiste sur un point: comme c’est géré serveur, OpenAI peut itérer vite, améliorer la méthode sans changer les clients, et optimiser au passage le caching et le routage. Côté Anthropic, l’observation est différente: Claude/Fable aurait tendance à s’organiser en sous-agents, chacun avec son propre contexte, qui se partagent le travail puis remontent l’essentiel. Avantage: impression de parallélisme et de vitesse. Risques: effort dupliqué, coût qui monte, et parfois des détails qui se perdent si un sous-agent ne remonte pas la bonne info. Et la conclusion est plutôt raisonnable: ces deux approches pourraient converger, avec de meilleurs résumés d’un côté et des workflows multi-agents plus robustes de l’autre. Accélération GPU et attention sparse Justement, quand on parle de long contexte, on retombe vite sur des contraintes très concrètes: GPU, mémoire, et calcul d’attention. MiniMax publie MiniMax Sparse Attention, un package Python open source sous licence MIT, avec des kernels d’attention denses et surtout des variantes “sparse” qui ne calculent pas tout partout. L’intérêt, c’est de réduire le travail quand la séquence devient énorme, tout en restant compatible avec des chemins d’exécution très optimisés. Pour l’écosystème, c’est un signal clair: sur la prochaine géné