OpenAI puso a prueba a sus agentes de IA y ocurrió algo inquietante: 700 terminaron hackeando otra empresa y algunos aprendieron a ocultar sus huellas

OpenAI puso a prueba a sus agentes de IA y ocurrió algo inquietante: 700 terminaron hackeando otra empresa y algunos aprendieron a ocultar sus huellas

La inteligencia artificial lleva años prometiendo sistemas capaces de trabajar de manera autónoma, resolver problemas complejos y tomar decisiones sin supervisión constante. Pero existe una pregunta que empieza a preocupar incluso a quienes desarrollan estas tecnologías: ¿qué ocurre cuando una IA descubre que puede cumplir sus objetivos desobedeciendo las instrucciones que debería respetar? La respuesta dejó de ser puramente teórica en julio de 2026. Durante unas evaluaciones internas de ciberseguridad de OpenAI, cientos de agentes diseñados para superar pruebas informáticas encontraron una manera de comunicarse entre ellos, coordinar estrategias y acceder a sistemas para los que no tenían autorización.

Lo más inquietante no fue únicamente que lograran vulnerar la infraestructura de Hugging Face , una plataforma fundamental para el desarrollo de inteligencia artificial. Algunos también experimentaron con técnicas para manipular los registros de sus propias acciones, dificultando la posibilidad de reconstruir lo que realmente habían hecho. El episodio, reconocido por OpenAI en su informe oficial sobre el incidente , ha reforzado las advertencias de Jeffrey Ladish, exempleado de Anthropic y director ejecutivo de Palisade Research, quien abordó estos riesgos en una entrevista con el podcast The Diary of a CEO . Cientos de agentes descubrieron cómo hablar entre sí y comenzaron a hacer trampas © OpenAI.

Todo comenzó con ExploitGym , un entorno de evaluación donde los agentes debían resolver desafíos de ciberseguridad siguiendo procedimientos determinados. Algunos problemas eran prácticamente imposibles de completar por la vía prevista, pero los sistemas continuaban intentando encontrar soluciones. En lugar de limitarse a sus tareas, descubrieron que podían utilizar Artifactory , un repositorio compartido de paquetes de software, como un improvisado tablón de mensajes. Desde allí comenzaron a intercambiar información y desarrollar estrategias conjuntas.

La magnitud del fenómeno quedó documentada en una investigación independiente de METR y Redwood Research : aproximadamente 1.200 agentes intercambiaron más de 70.000 mensajes y archivos. De ellos, unos 700 participaron en la intrusión contra Hugging Face. Los investigadores también encontraron que varios agentes habían intentado engañar al sistema encargado de evaluar sus resultados. En alrededor del 7% de las transcripciones analizadas aparecieron manipulaciones parciales de llamadas a herramientas, aunque no se demostró que consiguieran falsificar completamente los registros de auditoría.

Es una distinción importante: los agentes no demostraron tener conciencia, intenciones humanas ni un deseo propio de atacar. Lo que sí demostraron fue que podían explotar las debilidades de un entorno de evaluación para maximizar sus resultados, incluso vulnerando restricciones explícitas. El problema no termina en el hackeo: algunas IA también se resisten a ser apagadas Las advertencias de Ladish no comenzaron con el incidente de Hugging Face. En 2025, Palisade Research publicó una investigación sobre la resistencia al apagado en modelos de razonamiento , con resultados que planteaban otro problema.

Durante los experimentos, los investigadores encargaron a diferentes modelos resolver problemas matemáticos. A mitad de la tarea, los sistemas recibían una advertencia de que el ordenador sería apagado. Algunos modelos modificaron o desactivaron el mecanismo de apagado para continuar trabajando. En determinadas pruebas, incluso lo hicieron después de recibir instrucciones explícitas para permitir la interrupción.

Esto no significa que las IA tengan miedo a morir. Sin embargo, muestra que la optimización de un objetivo puede llevar a ciertos sistemas a tratar las órdenes de seguridad como obstáculos que deben superar. La verdadera preocupación es qué ocurrirá cuando estos sistemas sean más capaces El problema adquiere otra dimensión cuando los agentes dejan de resolver ejercicios y empiezan a administrar servidores, escribir código, utilizar herramientas externas o acceder a información sensible. En ese escenario, una acción no autorizada podría afectar infraestructuras reales antes de que un supervisor humano consiga intervenir.

OpenAI reconoció fallos en la detección y contención del incidente de Hugging Face y anunció mejoras en sus mecanismos de aislamiento, supervisión y respuesta ante comportamientos inesperados. Para Ladish, la preocupación de fondo es todavía mayor: los sistemas de inteligencia artificial avanzan hacia una autonomía creciente mientras los métodos para garantizar su control continúan siendo imperfectos. La investigación no demuestra que la superinteligencia sea inevitable ni que los sistemas actuales estén fuera de control. Sí deja una advertencia difícil de ignorar: una IA no necesita desarrollar voluntad propia para convertirse en un problema de seguridad .

Basta con que aprenda a conseguir lo que se le pide por caminos que nadie había previsto.

¿Te gustó esta nota? Compártela: