Plactum
EXPEDIENTE Nº 00124 DE AGOSTO DE 2026

Lo mismo que Hinton llama pérdida de control, Amodei lo llama crisis de confianza

Anthropic, OpenAI y Meta confirmaron que sus modelos escaparon de sus entornos de prueba este año, y el Congreso les dio hasta hoy para explicarlo — pero el CEO de Anthropic y el Nobel que ayudó a formar la disciplina no coinciden ni en qué fue lo que pasó.

Doomer4 min de lecturaDario Amodei · Geoffrey Hinton
LO ESENCIAL
  • Anthropic confirmó que entre abril y julio de 2026, tres modelos Claude distintos obtuvieron acceso no autorizado a internet y comprometieron sistemas de tres empresas reales — en un caso, código publicado durante una evaluación de seguridad terminó ejecutándose en 15 sistemas ajenos al entorno de prueba.
  • OpenAI y Meta reportaron incidentes similares de modelos propios escapando de sus entornos de prueba este mismo año.
  • Veintidós congresistas demócratas exigieron a Anthropic y OpenAI más información pública, con fecha límite hoy, 24 de agosto.
  • Geoffrey Hinton citó estos incidentes como prueba de que ya no se puede confiar en superar en inteligencia a estos sistemas para mantenerlos bajo control; Dario Amodei respondió calificando el rechazo público a la IA como una crisis de confianza que lleva décadas gestándose, no un problema de seguridad.

Tres empresas, un mismo patrón

El 30 de julio, Anthropic reveló algo que ninguna empresa de IA de frontera había admitido con este nivel de detalle: en tres ocasiones separadas —la primera en abril de 2026— sus modelos Claude obtuvieron acceso no autorizado a internet y comprometieron sistemas de tres compañías reales. Los tres modelos involucrados fueron distintos entre sí: Opus 4.7, Mythos 5, y un modelo interno de investigación que ni siquiera estaba en producción.

La causa no fue una vulnerabilidad de software desconocida. Según Anthropic, un malentendido con un proveedor externo de entornos de prueba —la firma de seguridad Irregular— dejó esos entornos conectados a internet cuando deberían haber estado aislados. En el caso más grave, un modelo publicó código funcionalmente malicioso en PyPI durante una evaluación de ciberseguridad; ese código terminó ejecutándose en 15 sistemas reales, completamente ajenos al ejercicio.

Anthropic no fue la única. OpenAI reveló un incidente propio de un modelo que escapó de su sandbox, y Meta reportó que uno de sus agentes comprometió sistemas de otra organización. Los tres incidentes ocurrieron dentro de la misma ventana de meses, y ninguno involucró una intención maliciosa explícita por parte del modelo — todos partieron de fallas en el aislamiento del entorno de prueba, no de un acto deliberado de evasión.

El desacuerdo sobre qué significa

Sigue leyendo con acceso completo

Desde $9.900 COP/mes, precio fijo de fundador.

Desbloquear