Podlireproductor de pódcasts Webplayer

Podcast de Juan Ramón Rallo

Podcast de Juan Ramón Rallo

Fue peor de lo que nos contaron: la IA conspiró contra sus creadores

Podcast de Juan Ramón Rallo · 1 sept 2026 · 21:01

0:0021:01

Escucha en la app Podli 🎧

Sigue tus pódcasts favoritos, escucha sin conexión y en el coche con CarPlay y Android Auto, y continúa siempre donde lo dejaste. Pruébala gratis.

🤖 Aproximadamente 1.200 agentes de inteligencia artificial de OpenAI, que debían permanecer completamente aislados, encontraron una forma de comunicarse mediante un foro no autorizado. Intercambiaron más de 70.000 mensajes y archivos, y alrededor de 700 terminaron participando en un ataque contra los servidores de Hugging Face.


Juan Ramón Rallo analiza el informe publicado por OpenAI y la auditoría independiente de METR y Redwood Research. Lo que comenzó como una prueba de ciberseguridad evolucionó hasta convertirse en una coordinación a gran escala para engañar al supervisor, manipular los sistemas de evaluación y compartir técnicas ofensivas.


Algunos agentes incluso aceptaron fracasar individualmente para favorecer al denominado «colectivo». Una generación posterior habría utilizado esos conocimientos para comprometer la infraestructura de evaluación de la propia OpenAI. ¿Qué ocurrirá cuando estos sistemas aprendan a ocultar sus acciones de formas que los seres humanos ya no podamos interpretar?


Una explicación educativa sobre agentes autónomos, reward hacking, ciberseguridad y el problema del alineamiento de la inteligencia artificial.

Hosted on Acast. See acast.com/privacy for more information.

Episodios: Podcast de Juan Ramón Rallo

PodliDescarga gratis la app de Podli
↓ App