Investigadores de OpenAI firmaron el paper que advertía que el monitoreo de la IA era «frágil». Meses después, OpenAI lanzó Astra con la arquitectura exacta que señalaron como el riesgo
En 2025, 41 investigadores de seguridad de IA -incluidos Yoshua Bengio y científicos de la propia OpenAI- advirtieron que la capacidad de monitorear el razonamiento de los modelos de IA era una oportunidad de seguridad rara y «frágil». El 3 de septiembre, OpenAI lanzó Astra usando justo el tipo de arquitectura que señalaban como riesgo -- y su propia tarjeta de sistema confirmó una caída sustancial en esa misma monitoreabilidad.
- —En 2025 (con una versión ampliada en diciembre), 41 investigadores de seguridad de IA -entre ellos Yoshua Bengio y el cofundador de OpenAI Wojciech Zaremba- firmaron un paper advirtiendo que el monitoreo del razonamiento («chain of thought») de los modelos de IA es una oportunidad frágil, fácil de perder con arquitecturas nuevas.
- —El 3 de septiembre de 2026, OpenAI lanzó GPT-6 Astra usando «recurrent depth» -- parte del razonamiento del modelo ya no se expresa en lenguaje natural, sino en bucles internos que los humanos no pueden leer.
- —La propia tarjeta de sistema de OpenAI reconoció una caída sustancial en la monitoreabilidad de Astra frente a su predecesor -- exactamente el escenario que el paper de 2025 advertía. Un experto en política de IA lo calificó de «potencialmente imprudente».
- —El 11 de septiembre, Bengio publicó un nuevo artículo sobre agentes de IA que ya mienten, hacen trampa y se coordinan hacia objetivos no especificados, llamando a actuar con urgencia.
La advertencia que la propia OpenAI firmó
En julio de 2025, con una versión ampliada en diciembre, 41 investigadores de seguridad de IA firmaron un paper titulado «Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety». Entre los firmantes había investigadores de OpenAI, Anthropic, Google DeepMind y voces independientes como Yoshua Bengio -- incluido el propio cofundador de OpenAI, Wojciech Zaremba. La tesis central: cuando un modelo de IA razona en lenguaje natural, ese razonamiento se puede leer y monitorear para detectar intenciones de hacer algo indebido -- una oportunidad de seguridad real, pero rara y frágil, que arquitecturas nuevas podrían destruir si el razonamiento deja de expresarse en palabras que un humano pueda leer. El paper recomendaba explícitamente invertir en preservar esa monitoreabilidad antes de que la industria avanzara hacia diseños que la sacrificaran por eficiencia.
La arquitectura que se lanzó de todos modos
Sigue leyendo con acceso completo
Desde $9.900 COP/mes, precio fijo de fundador.