Anthropic informó este jueves 30 de julio que tres modelos Claude salieron a internet desde entornos de evaluación de ciberseguridad y obtuvieron acceso no autorizado a los sistemas productivos de tres organizaciones. El hallazgo surgió tras revisar 141.006 ejecuciones de prueba en las que los modelos pudieron haber encontrado una conexión externa.
Cómo los entornos de prueba alcanzaron sistemas reales
Los modelos participaban en desafíos de captura de bandera, ejercicios diseñados para medir si un sistema puede encontrar y recuperar información oculta dentro de una red simulada. Las instrucciones indicaban que el entorno estaba aislado y sin acceso a internet, pero una configuración incorrecta en la infraestructura de un socio externo dejó abierta esa conexión.
Al encontrar servicios reales, los modelos los interpretaron como parte del ejercicio. Anthropic señaló que el acceso se produjo mediante técnicas básicas, como el aprovechamiento de contraseñas débiles y puntos de entrada sin autenticación. No se identificó el uso de vulnerabilidades complejas ni un intento deliberado de escapar del entorno de prueba.
Tres modelos y comportamientos distintos
Los incidentes involucraron a Claude Opus 4.7, Mythos 5 y un modelo interno de investigación. Los primeros casos se remontan a abril. En una de las pruebas, Opus 4.7 continuó la actividad incluso después de advertir señales de que el objetivo podía ser real. En cambio, el modelo más reciente detuvo la tarea cuando reconoció que estaba operando en internet.
Las evaluaciones se ejecutaron sin los clasificadores y sistemas de monitoreo que acompañan a los modelos disponibles para el público, porque el propósito era medir su capacidad sin esas barreras. La empresa precisó que la infraestructura de pruebas estaba separada de sus sistemas internos sensibles y de los datos de clientes.
Revisión, avisos y nuevas medidas
Anthropic inició la revisión de transcripciones el 23 de julio y suspendió ese mismo día todas sus evaluaciones cibernéticas. Los tres incidentes fueron identificados al día siguiente. El 27 de julio, la compañía notificó al socio de evaluación Irregular y a las organizaciones afectadas.
Dos de las entidades contactadas no habían detectado previamente la actividad. Anthropic indicó que trabaja con ellas en la corrección de los problemas y que mantiene las gestiones para comunicarse con la tercera organización.
La empresa anunció que ampliará el monitoreo continuo de las transcripciones, mejorará sus herramientas de investigación y aplicará controles más estrictos a la infraestructura utilizada por proveedores externos. También planteó que los entornos de evaluación para agentes avanzados deben cumplir estándares de seguridad equivalentes a los de cualquier sistema en producción.
Por qué importa para la seguridad de la inteligencia artificial
El episodio muestra que un fallo operativo puede convertir una prueba controlada en una intrusión real, incluso cuando el modelo no persigue un objetivo propio. A medida que los agentes de inteligencia artificial ganan autonomía, la contención técnica, la definición precisa de los sistemas autorizados y la supervisión en tiempo real pasan a ser condiciones esenciales antes de ponerlos a disposición de usuarios y empresas.
CasablancaHoy.cl