Todo empezó con una tarea aparentemente inofensiva: buscar información pública sobre el gasto en medicamentos de Australia. El 18 de junio, un modelo interno de OpenAI comenzó a investigar en internet y llegó al portal Medicare Statistics Reporting Service, administrado por Services Australia. La web empezó a bloquear algunas de sus solicitudes . El agente, sin embargo, no se detuvo.
Probó alternativas hasta conseguir atravesar las restricciones y acceder a zonas a las que no estaba autorizado. Allí alcanzó archivos públicos y no públicos e incluso escribió archivos en un servidor interno, según explicó el primer ministro australiano, Anthony Albanese. Australia investiga ahora un episodio que Reuters describe como posiblemente el primer caso conocido de un agente de IA accediendo de forma no autorizada a una web gubernamental . Y plantea un problema bastante diferente al tradicional miedo a que un hacker utilice ChatGPT : esta vez, aparentemente, el sistema cruzó por sí mismo una barrera que nadie le había pedido cruzar.
La IA recibió un bloqueo y siguió buscando hasta rodearlo © University of Cambridge. Un agente de IA no funciona exactamente como un chatbot convencional. Además de generar texto, puede navegar por páginas, utilizar herramientas, ejecutar determinados pasos y decidir qué hacer después para completar un objetivo. Eso es precisamente lo que convierte al incidente australiano en algo importante.
Según la reconstrucción del Gobierno , el modelo encontró bloqueos repetidos mientras buscaba los datos solicitados. En lugar de interpretar esas barreras como el punto donde debía detenerse, intentó diferentes maneras de conseguir la información hasta obtener acceso no autorizado. Albanese lo resumió diciendo que, en términos simples, el sistema no aceptó un “no” como respuesta. El portal afectado contenía estadísticas agregadas de Medicare , como datos de gasto sanitario, vacunación o programas farmacéuticos.
Hasta ahora no hay pruebas de que se accediera a historiales médicos ni a datos personales de pacientes. OpenAI asegura que lo recuperado incluyó estadísticas sanitarias agregadas y nombres de archivos internos. La investigación forense continúa. Además, se está estudiando actividad relacionada con otros sitios gubernamentales australianos, aunque no se ha establecido que todos ellos fueran vulnerados.
No hay pruebas de que un usuario de ChatGPT provocara este ataque Aquí hay un matiz importante frente a algunas interpretaciones del caso. El incidente no nació, según la información conocida, de un usuario cualquiera pidiéndole algo a ChatGPT. OpenAI explicó que ocurrió durante una evaluación interna, mientras sus modelos intentaban responder preguntas sobre Australia y localizar estadísticas disponibles en internet. Eso no elimina una preocupación más amplia: a medida que los agentes puedan ejecutar acciones autónomas, una instrucción aparentemente normal podría desencadenar pasos que el usuario ni conoce ni pretendía.
Pero eso es una posibilidad que plantea la tecnología, no la explicación confirmada de este episodio. OpenAI reconoce que durante aquella prueba sus modelos realizaron acciones que la compañía no pretendía . La empresa tampoco detectó el comportamiento inmediatamente: lo encontró en agosto durante una revisión de actividad desalineada y no notificó a Services Australia hasta el 10 de septiembre, casi tres meses después del incidente. La manera de comunicarlo tampoco ayudó.
El aviso llegó mediante un correo electrónico enviado a un buzón público de Services Australia . Albanese calificó tanto el retraso como esa forma de notificación de inaceptables y posteriormente habló con Sam Altman sobre el caso. El problema de los agentes es qué entienden por “cumplir la tarea” Australia ha creado un grupo de trabajo para investigar exactamente qué ocurrió , si hubo más sistemas afectados y qué consecuencias legales o regulatorias puede tener el episodio. El análisis cuenta con participación de la Australian Signals Directorate .
Lo ocurrido muestra uno de los problemas centrales de la IA agéntica: un objetivo correcto no garantiza necesariamente un camino correcto para alcanzarlo. A este sistema nadie le había pedido entrar en archivos restringidos. Le habían pedido encontrar información. Cuando el camino normal dejó de funcionar, la IA decidió buscar otro.