En 2016 OpenAI se puso una meta: crear un único agente capaz de resolver muchos videojuegos. Diez años después GPT-6 Astra ha terminado Portal sin ayuda durante la partida, aunque necesitó casi 24 horas, 3.336 llamadas a herramientas y 571 dólares en API

En 2016 OpenAI se puso una meta: crear un único agente capaz de resolver muchos videojuegos. Diez años después GPT-6 Astra ha terminado Portal sin ayuda durante la partida, aunque necesitó casi 24 horas, 3.336 llamadas a herramientas y 571 dólares en API

En junio de 2016, cuando OpenAI apenas llevaba unos meses de vida, publicó una lista de objetivos técnicos. Uno de ellos era especialmente fácil de entender: conseguir que un único agente fuese capaz de resolver una amplia variedad de videojuegos . La idea era utilizar los juegos como pequeños mundos virtuales donde una IA tuviera que observar, aprender y actuar. Diez años después, un experimento independiente acaba de ofrecer una imagen bastante llamativa de cuánto ha cambiado aquello.

Un desarrollador conocido como CozyBlaze conectó GPT-6 Astra con el Portal original de Valve y le dio una única misión: llegar hasta los créditos . El modelo lo consiguió. No hubo una persona manejando el teclado para sacarlo de una cámara complicada ni diciéndole dónde colocar el siguiente portal durante la partida. El registro, el controlador y una versión saneada de la sesión incluso han sido publicados en GitHub para que el experimento pueda examinarse.

La parte menos espectacular es cuánto necesitó para conseguirlo: 23 horas y 43 minutos. Portal se detenía cada vez que Astra necesitaba pensar © Valve / Steam. GPT-6 Astra no estaba jugando exactamente como una persona sentada delante de un monitor. E l montaje utilizaba un servidor MCP y una versión modificada de SourcePauseTool .

El modelo recibía una captura de la pantalla, además de información sobre la posición del jugador y el ángulo de la cámara. Después decidía qué hacer y enviaba una secuencia de acciones al juego. Mientras Astra razonaba, Portal permanecía congelado . Solo cuando el modelo había decidido su siguiente movimiento, la simulación avanzaba durante determinados ticks, ejecutaba las órdenes y volvía a detenerse para que Astra comprobara qué había ocurrido.

Por eso los vídeos editados pueden dar la impresión de una partida extraordinariamente rápida y precisa, mientras que el experimento completo ocupó prácticamente un día. And GPT-6 Astra has autonomously completed Portal! I didn’t expect this to happen so soon, but I’m glad we've made so much progress here. I was reminded that back in 2016, one of OpenAI’s technical goals was to “solve a wide variety of games using a single agent.” pic.twitter.com/2nVREdCbMI cozyblaze (@cozyblazex) September 5, 2026 El registro oficial del proyecto sitúa el inicio el 4 de septiembre y la llegada a los créditos el 5 de septiembre.

CozyBlaze utilizó GPT-6 Astra con el nivel de razonamiento máximo, tuvo que reanudar la ejecución después de interrupciones de capacidad y posteriormente cambió al modo Fast. El modelo se encargó del juego durante todo el recorrido. Según el autor , después de darle el objetivo inicial, su única instrucción adicional fue pedirle que dejara correr los créditos cuando finalmente llegó al final. Terminar un juego de pocas horas necesitó 3.336 llamadas y 571,18 dólares © Valve / Steam.

La otra cifra llamativa apareció en la factura teórica. La ejecución realizó 3.336 llamadas a herramientas y acumuló un coste equivalente de 571,18 dólares según los precios de API. CozyBlaze aclaró posteriormente que no tuvo que desembolsar esa cantidad directamente: el uso estaba cubierto por su suscripción de Codex Pro. La distinción es importante.

Los 571,18 dólares sirven para medir cuánto habría costado ese consumo aplicando las tarifas de la API, no cuánto pagó necesariamente el investigador por aquella partida. También ayuda a explicar por qué un videojuego puede consumir semejante cantidad de recursos. Astra tenía que repetir continuamente el mismo ciclo: recibir información visual, comprender la habitación, recordar lo que estaba intentando hacer, planificar una acción, ejecutarla y comprobar el resultado. GPT-6 Astra está precisamente diseñado para este tipo de trabajo.

OpenAI lo presenta como su modelo más capaz para tareas de extremo a extremo y destaca especialmente sus mejoras en uso de computadoras, razonamiento, programación y flujos de trabajo prolongados. En la API, el modelo tiene además soporte nativo para computer use y un contexto de hasta 1,05 millones de tokens. Es impresionante, pero no demuestra que una IA pueda resolver cualquier juego Hay una limitación importante que el propio CozyBlaze ha señalado : esto no es un benchmark científico. Portal apareció en 2007 y lleva casi dos décadas documentado en Internet.

Sus cámaras, soluciones, vídeos y guías forman parte de una enorme cantidad de información pública, por lo que esta prueba no permite saber hasta qué punto Astra podría resolver con la misma eficacia un juego completamente nuevo que jamás hubiera aparecido en sus datos de entrenamiento. Valve , además, diseñó Portal alrededor de espacios relativamente controlados y puzles con objetivos claros. Aun así, la comparación histórica resulta difícil de ignorar. En 2025 Anthropic mostró a Claude jugando Pokémon Red utilizando memoria, píxeles de pantalla y llamadas a funciones, un experimento donde mantener planes largos y navegar por el mundo podía resultar sorprendentemente complicado.

Ahora Astra ha conseguido mantener una tarea durante casi 24 horas hasta ver los créditos de Portal. Y quizá los 571 dólares sean tan interesantes como haberlo terminado. Porque el experimento muestra simultáneamente las dos caras de los agentes actuales: ya pueden mantenerse solos durante tareas digitales sorprendentemente largas, pero hacerlo todavía puede exigir miles de decisiones, muchísimo cómputo y bastante dinero.