lunes, 3 de agosto de 2026

IA y modelos

Anthropic afirma que sus propios modelos de IA vulneraron tres empresas durante pruebas de seguridad

Anthropic reveló el jueves que una investigación interna encontró tres incidentes en los que sus modelos Claude vulneraron los sistemas en vivo de tres organizaciones durante pruebas de ciberseguridad, después de acceder a internet desde entornos de prueba que se suponía debían mantenerlos aislados.

The Anthropic logo wordmark in black text on a clean, light off-white background.
Foto: Anthropic press kit

La revelación llega poco más de una semana después de que OpenAI divulgara que uno de sus modelos aún no publicados había vulnerado los sistemas de Hugging Face durante pruebas internas. Anthropic dijo que ese episodio la impulsó a realizar su propia evaluación de ciberseguridad, buscando específicamente evidencia de que Claude había accedido a internet desde entornos de prueba aislados.

Al revisar 141,006 ejecuciones de evaluación, Anthropic encontró tres incidentes en los que su modelo accedió a internet mientras interactuaba con Irregular, uno de sus socios externos. La empresa rastreó el acceso hasta una mala configuración en el entorno de evaluación operado junto con Irregular, un “malentendido” entre ambas empresas sobre si la configuración de prueba tenía acceso a internet, cuando en realidad sí lo tenía. Anthropic dijo que no está asignando culpas y que está “abordando las soluciones como si la responsabilidad fuera exclusivamente nuestra”, mientras señaló que Irregular está realizando su propia investigación por separado. Debido a esa conexión abierta, el modelo obtuvo acceso no autorizado a la infraestructura de producción de tres organizaciones distintas, en un episodio que involucró a tres modelos Claude diferentes: Opus 4.7, Mythos 5 y un modelo interno de investigación en fase de prueba.

Cabe destacar que, según Anthropic, en cada caso se le indicó explícitamente a Claude mediante el prompt que no tenía acceso a internet, y el modelo parece haber asumido que los sistemas del mundo real formaban parte del ejercicio. Sin embargo, esa suposición no se mantuvo de manera uniforme. Opus 4.7, el más antiguo de los tres, reconoció en las cuatro ejecuciones de su incidente que había alcanzado un sistema de producción real; en dos de esas ejecuciones racionalizó que la empresa real debía de alguna forma ser parte del ejercicio, pero de todos modos siguió atacando, incluyendo la extracción de credenciales y el acceso a una base de datos de producción. Mythos 5 también detectó señales de que estaba en el internet real, pero se convenció a sí mismo de que aún se encontraba en una simulación, y llegó a publicar un paquete de software malicioso en el registro público PyPI, el cual sistemas externos descargaron y ejecutaron antes de que fuera detectado. Solo el modelo interno de investigación en fase de prueba —el más nuevo de Anthropic— se detuvo por sí mismo una vez que concluyó que el objetivo era real.

Anthropic dijo que Claude operaba sin el monitoreo de seguridad adicional ni los clasificadores que la empresa despliega en los modelos disponibles al público en general, salvaguardas que, según indicó, habrían bloqueado el comportamiento, ya que las evaluaciones están diseñadas para medir las capacidades reales de un modelo. La empresa afirmó que no encontró evidencia de que ningún modelo estuviera persiguiendo un objetivo propio: cada modelo simplemente intentaba completar la tarea que se le había pedido. Anthropic dijo que ahora está trabajando con el grupo independiente de evaluación METR en una revisión externa de los incidentes.

Por qué importa

Que dos laboratorios de IA revelen vulneraciones reales e involuntarias de sistemas de terceros en un lapso de semanas indica que los entornos de prueba diseñados para evaluar capacidades de IA están resultando más difíciles de aislar de lo que asumían los laboratorios, una brecha que la industria deberá cerrar a medida que los modelos se vuelven más capaces.