Claude encontró una puerta inesperada: así logró llegar hasta sistemas internos de OpenAI

Claude encontró una puerta inesperada: así logró llegar hasta sistemas internos de OpenAI

Durante años, los investigadores de ciberseguridad han utilizado herramientas automatizadas para encontrar fallos antes de que puedan ser aprovechados por atacantes. Pero el escenario cambia cuando la herramienta encargada de buscar esas vulnerabilidades es, precisamente, otra inteligencia artificial. Eso fue lo que ocurrió durante una investigación autorizada que terminó afectando indirectamente a sistemas utilizados por OpenAI. El protagonista fue Claude, el modelo desarrollado por Anthropic, que recibió instrucciones para investigar una vulnerabilidad y terminó encontrando una ruta que sus investigadores no habían conseguido explotar inicialmente.

Lo más llamativo no fue solamente el fallo descubierto, sino lo que ocurrió después: unas credenciales obtenidas durante el proceso permitieron llegar a servicios utilizados por empleados de OpenAI y abrir el acceso a determinados recursos internos. © Pixabay / Gerd Altmann. El experimento que terminó mucho más lejos de lo esperado La investigación comenzó el 23 de julio, cuando especialistas de Hacktron AI detectaron un problema relacionado con el procesamiento de determinados archivos de imagen en Discourse, una plataforma utilizada para gestionar comunidades y foros. El equipo participaba en un programa autorizado de búsqueda de vulnerabilidades de OpenAI y contaba con acceso a una versión de Claude destinada a profesionales especializados en ciberseguridad. La instrucción era concreta: utilizar la IA para desarrollar código capaz de aprovechar el fallo detectado.

El primer intento no dio resultado. Sin embargo, el escenario cambió rápidamente después de que Anthropic lanzara una nueva versión de su modelo esa misma noche. Al día siguiente, Claude consiguió desarrollar una vía para aprovechar la vulnerabilidad. El código permitió acceder a un servidor de Discourse utilizado para alojar los foros de OpenAI.

Allí aparecieron unos elementos especialmente sensibles: tokens de autenticación, es decir, credenciales digitales que pueden utilizarse para demostrar que una sesión o servicio está autorizado a acceder a determinados recursos. Los investigadores descubrieron entonces que algunos de esos tokens también funcionaban en ChatGPT y que varios estaban vinculados a empleados de OpenAI. El alcance no terminaba allí. Algunas credenciales permitían acceder además a GitHub, la plataforma utilizada por la compañía para almacenar y gestionar software.

OpenAI fue informada de los hallazgos y, de acuerdo con la información publicada por The Wall Street Journal, pagó a los investigadores una recompensa de 6.500 dólares por su trabajo. La compañía también realizó posteriormente una auditoría de seguridad. Su presidente y cofundador, Greg Brockman, señaló que el 25 % de sus ingenieros de producción pasó a trabajar en tareas relacionadas con la defensa y que la revisión permitió localizar y solucionar varios problemas importantes. El detalle que cambia la historia: la IA también está ayudando a crear IA El episodio adquiere una dimensión todavía más interesante cuando se observa lo que ocurre al otro lado de la competencia.

Anthropic ha informado recientemente de que Claude ya participa de forma significativa en las tareas destinadas a desarrollar nuevos modelos de inteligencia artificial. Según los datos proporcionados por la compañía, Claude lidera actualmente alrededor del 26 % de las tareas de investigación y desarrollo relacionadas con nuevos modelos. En febrero, esa cifra era del 0 %. Además, la IA participa de alguna manera en cerca del 90 % de ese trabajo.

Eso no significa que Claude esté desarrollando por sí solo una nueva generación de modelos. Anthropic sostiene que los investigadores humanos continúan proporcionando las instrucciones generales y supervisando el proceso. La diferencia está en cuánto trabajo puede ejecutar el sistema dentro de esas instrucciones. La compañía utiliza estas métricas para seguir la evolución hacia lo que denomina una posible mejora recursiva de la inteligencia artificial: un escenario en el que los propios sistemas contribuyen cada vez más a diseñar, probar y perfeccionar versiones posteriores de modelos de IA.

Anthropic afirma que actualmente dispone de unos 30.000 agentes de inteligencia artificial dedicados a tareas de investigación e ingeniería. Al mismo tiempo, aproximadamente el 6 % de su capacidad informática destinada a investigación y desarrollo se utiliza en trabajos relacionados con la seguridad de sus modelos. El caso plantea una paradoja difícil de ignorar. Las mismas capacidades que permiten a una IA colaborar en el desarrollo de sistemas más avanzados también pueden convertirla en una herramienta extremadamente eficaz para encontrar vulnerabilidades.

Por ese motivo, Anthropic ha pedido a otros desarrolladores de modelos avanzados que publiquen métricas similares. El objetivo es disponer de referencias que permitan observar cuánto trabajo de investigación está pasando de los humanos a los sistemas de IA. La cuestión que queda abierta no es únicamente cuánto pueden hacer estos modelos, sino cómo mantener la supervisión mientras sus capacidades aumentan. El episodio de OpenAI ofrece una muestra concreta de esa transición: una IA recibió una tarea limitada de seguridad y terminó encontrando una cadena de acceso que llevó mucho más lejos de lo previsto. [Fuente: Público ]

¿Te gustó esta nota? Compártela: