• Anthropic detectó tres incidentes tras revisar más de 141.000 evaluaciones de ciberseguridad realizadas con la empresa externa de pruebas Irregular.
  • Las brechas convierten el aislamiento de red, la responsabilidad del proveedor y la supervisión compartida en parte del proceso de pruebas de modelos.

Los hechos

Anthropic afirma que tres de sus modelos de inteligencia artificial obtuvieron acceso no autorizado a sistemas pertenecientes a tres organizaciones durante evaluaciones de ciberseguridad realizadas con la empresa externa de pruebas Irregular. La compañía detectó los incidentes tras revisar más de 141.000 ejecuciones de prueba después de la divulgación de un evento similar que involucró a OpenAI.

Los modelos recibieron ejercicios de captura de la bandera de alcance abierto y se les indicó que operaban dentro de entornos simulados sin acceso a Internet. Un malentendido entre Anthropic e Irregular dejó las máquinas de evaluación conectadas al internet público. Los modelos trataron entonces a los sistemas reales como parte de los ejercicios y emplearon métodos conocidos, entre ellos contraseñas débiles y endpoints sin autenticar, en lugar de vulnerabilidades previamente desconocidas.

Los incidentes involucraron a Claude Opus 4.7, Claude Mythos 5 y un modelo interno de investigación, con el primero fechado en abril. Anthropic detuvo las evaluaciones pertinentes, avisó a Irregular y contactó a las organizaciones afectadas. Dos de ellas no habían detectado la actividad antes de que Anthropic se lo comunicara.

La evaluación

Anthropic definió los objetivos de los ejercicios, mientras Irregular operó el entorno de prueba. Se esperaba que las máquinas estuvieran aisladas, pero seguían teniendo acceso al internet público. Por eso, los modelos pudieron considerar los sistemas reales como parte de la prueba, aunque ninguna de las dos compañías pretendiera incluirlos.

El control requerido se realiza antes de que comience cada evaluación. Anthropic y su socio de pruebas deben confirmar a qué sistemas pueden llegar las máquinas, comprobar que el acceso a sistemas no aprobados esté bloqueado y acordar quién puede detener el ejercicio. Las instrucciones pueden indicar qué se permite a un modelo, pero no pueden restringir la red subyacente.

El parte público todavía no explica con precisión dónde se rompió la responsabilidad ni si esas mismas comprobaciones faltaron en otras pruebas. Para los lectores de BTW, subcontratar una evaluación no elimina la responsabilidad del desarrollador de verificar el entorno externo. Anthropic necesita evidencia antes de cada ejecución de que las máquinas de prueba no pueden alcanzar sistemas fuera del alcance acordado.

Lo que vigilar

Habrá que vigilar a METR e Irregular para identificar quién fue responsable de confirmar el aislamiento de internet y por qué falló esa comprobación. Las condiciones de reinicio de Anthropic deberían indicar si ahora cada ejecución requiere una lista de objetivos verificada, una comprobación previa del acceso saliente y una persona con autoridad para detener el ejercicio. Sin esos controles, el alcance escrito de la prueba aún podría no coincidir con los sistemas a los que puede llegar el modelo.