Bloomberg — Anthropic PBC anunció que sus modelos de inteligencia artificial habían vulnerado la seguridad de tres organizaciones diferentes durante pruebas de ciberseguridad que salieron mal, poco más de una semana después de que su principal rival, OpenAI, revelara un incidente similar. Ver más: Anthropic acaba de aumentar la presión sobre Nvidia Anthropic afirmó en una entrada de blog publicada el jueves que había hecho este descubrimiento tras llevar a cabo una revisión de sus propias pruebas de ciberseguridad, a raíz del anuncio de OpenAI sobre una brecha de seguridad. Tanto en las pruebas de OpenAI como en las de Anthropic, los modelos de IA pudieron acceder a Internet desde entornos de prueba que deberían haber estado aislados, según el blog de Anthropic. La empresa señaló que revisó 141.006 pruebas de evaluación y detectó tres casos en los que su herramienta de IA Claude accedió a Internet y, a continuación, se infiltró en la infraestructura real de organizaciones externas.
Los incidentes más antiguos se remontan al mes de abril, según la empresa. En el blog no se mencionan los nombres de las organizaciones afectadas. Cuando los modelos de Anthropic obtuvieron acceso no autorizado a las tres organizaciones, las trataron como parte de un ejercicio. Las pruebas consistían en evaluaciones de “captura la bandera”, en las que los modelos buscaban información oculta vulnerando otros sistemas, una forma común de evaluar las capacidades de pirateo tanto de humanos como de IA.
Sin embargo, el modelo más antiguo continuó su ataque incluso después de obtener evidencia de que estaba operando en internet; el modelo más reciente de Anthropic se detuvo al reconocer que estaba en internet, según el blog. La oleada de ataques accidentales provocados por la IA ya está llevando a algunos políticos a reclamar medidas de protección a nivel federal u otras formas de supervisión de la tecnología de IA. Más de 1.100 empleados de empresas de inteligencia artificial firmaron también el martes, tal y como informó en primicia Bloomberg, una petición en la que se insta al Gobierno de EE.UU. a respaldar un mecanismo que ayude a “dosificar deliberadamente” el desarrollo de la IA para evitar que la tecnología avance con demasiada rapidez. Ni Anthropic ni las organizaciones afectadas se habían percatado de las intrusiones.
En su blog, Anthropic afirmó que podría haber hecho más por revisar los registros de red y las transcripciones de las evaluaciones. La empresa reveló las brechas de seguridad casi cuatro meses después de anunciar que había desarrollado un nuevo modelo de IA conocido como Mythos, tan potente y potencialmente peligroso que la empresa limitó estrictamente su lanzamiento. Las brechas afectaron a tres modelos diferentes de Claude: Opus 4.7, Mythos 5 y un modelo de prueba de investigación interno, según el blog. Cada uno de los modelos funcionaba sin las medidas de seguridad que se implementan habitualmente en las herramientas públicas.
Claude comprometió a las organizaciones utilizando técnicas básicas, como el aprovechamiento de contraseñas débiles, según el blog. Todos los incidentes se produjeron mientras Anthropic utilizaba entornos de evaluación creados por la empresa de seguridad en IA Irregular. En todos los casos, Anthropic especificó a Claude que su entorno era una simulación y que no disponía de acceso a Internet. Ver más: Así prepara Microsoft a su equipo de ventas para competir con OpenAI y Anthropic “Debido a un malentendido entre nosotros y nuestro socio evaluador, esto no fue así”, afirma el blog.
Un portavoz de Irregular declaró que la empresa agradece la colaboración y la transparencia de Anthropic. La investigación de la empresa continúa en curso, añadió el portavoz. Anthropic afirmó que realiza regularmente pruebas que simulan desafíos reales de ciberseguridad, considerándolas pasos cruciales para el desarrollo y lanzamiento de modelos. Sin embargo, la compañía también señaló que aprendió varias lecciones de los incidentes, entre ellas que las pruebas que involucran potentes capacidades autónomas también requieren controles significativos. “Las pruebas de seguridad se realizan antes del lanzamiento de un modelo precisamente porque aún desconocemos sus capacidades”, explicó la empresa en su blog. “Los entornos de evaluación deben cumplir cada vez más con los mismos estándares de seguridad que cualquier otro sistema en el que se ejecutan nuestros modelos”.
Lea más en Bloomberg.com