Las dos IA que existen, pero tú no puedes usar: ChatGPT Astra y Claude Mythos 5.1 están reservadas para unos pocos

Las dos IA que existen, pero tú no puedes usar: ChatGPT Astra y Claude Mythos 5.1 están reservadas para unos pocos

La realidad de la inteligencia artificial está a años luz de lo que tenemos ahora mismo en nuestro ordenador o móvil. Existen modelos con capacidades tan sorprendentes que no han visto la luz por el momento o que únicamente se ofrecen a unos pocos usuarios verificados en el mundo. Da igual que pagues por ChatGPT, Claude o utilices las versiones más avanzadas que aparecen en sus aplicaciones, tú vas a seguir sin tener acceso a algunos de los modelos más interesantes que existen detrás de ellas. Tanto OpenAI como Anthropic tienen modelos muy avanzados que no están disponibles para el gran público.

Sin ir más lejos, ayer se lanzaba Astra por parte de OpenAI, siendo el primero en alcanzar su nivel “Crítico” de capacidad en ciberseguridad. Por su parte, Claude Mythos 5.1, solo se ofrece a un pequeño grupo de organizaciones previamente verificadas. No estamos exactamente ante dos modelos secretos. Sabemos sus nombres, hemos visto de lo que son capaces y sus creadores nos han explicado lo que son capaces de hacer.

La parte misteriosa está em que sus desarrolladores consideran que determinadas capacidades ya son demasiado sensibles para entregarlas sin restricciones a cualquiera. Astra es la primera IA de OpenAI que cruza una línea que nunca había cruzado Astra todavía no aparece como una opción que puedas seleccionar dentro de ChatGPT. Fue anunciado ayer 1 de septiembre, alcanzando el nivel “Critical” de ciberseguridad de su Preparedness Framework. Es la primera vez que OpenAI clasifica así uno de sus modelos.

Para alcanzar ese límite, un modelo debe ser capaz de encontrar vulnerabilidades desconocidas y desarrollar exploits funcionales contra numerosos sistemas protegidos sin necesitar que una persona le indique cada paso, además de saber diseñar y ejecutar estrategias novedosas de ataque de extremo a extremo a partir de un objetivo general. Descubrió dos vulnerabilidades desconocidas mientras lo estaban evaluando Astra obtuvo una puntuación perfecta en ExploitBench, una prueba destinada a evaluar la capacidad para desarrollar exploits a partir de vulnerabilidades conocidas. El problema es que, utilizar este banco de pruebas, exponía su modelo al público. Por ello, creo una prueba interna con 20 vulnerabilidades graves publicadas recientemente.

Durante esa prueba ocurrió algo que no estaba previsto y es que Astra encontró y utilizó dos vulnerabilidades zero-day como parte de una cadena de explotación. OpenAI ha confirmado que ya las ha notificado a las empresas afectadas. El problema ahora es cómo poner una herramienta tan potente en manos del gran público. La realidad es que no podremos usarla sin salvaguardas.

OpenAI ya ha confirmado que Astra estará disponible “pronto”, pero sus capacidades de ciberseguridad más avanzadas tendrán un acceso mucho más restringido. Claude Mythos 5.1 sí está lanzado, pero probablemente tampoco puedas utilizarlo Anthropic está siguiendo un camino parecido, aunque con matices diferentes. Claude Mythos 5.1 fue anunciado el 1 de septiembre. Sus creadores lo definen como “su modelo más capaz para investigación en ciberseguridad y biología”.

Por el momento, sigue reservado a un grupo concreto de organizaciones, principalmente especialistas en ciberdefensa y ciencias de la vida mediante programas de acceso de confianza. Además, solo se proporciona acceso a Mythos 5.1 a determinadas organizaciones estadounidenses. Sin embargo, el gran público sí puede utilizarlo “más o menos”. Aquí entra en juego Claude Fable 5.1. que básicamente es el mismo modelo subyacente, pero con salvaguardas que se aplican en áreas sensibles.

Este modelo puede utilizarse por cualquiera que esté suscrito a los planes de pago de Anthropic, pero cuando el usuario entre en zonas consideradas demasiado sensibles, el modelo se bloqueará o redirigirá sus consultas. Esto impide trabajos como generación de exploits, pentesting y determinadas búsquedas de vulnerabilidades sobre binarios. En el caso de biología y la química vemos como algunas preguntas de doble uso son desviadas hacia modelos con restricciones mayores. Project Glasswing y Mythos Preview Anthropic presentó en abril Project Glasswing que buscaba ofrecer esa IA avanzada a organizaciones como AWS, Apple, Cisco, CrowdStrike, Google, Microsoft, NVIDIA y la Linux Foundation.

El modelo utilizado por entonces era Mythos Preview y consiguió identificar miles de vulnerabilidades zero-day en software de infraestructura crítica. En resumen, existen modelos muy capaces que no podemos usar, y no precisamente porque sean mejores. Por ejemplo, no son mejores en escribir un correo, resumir un PDF, traducir un texto o contestar preguntas generales. Sin embargo, cuentan con restricciones relacionadas a determinadas capacidades de alto riesgo.

Ambos modelos tienen el foco en la ciberseguridad avanzada. Estamos empezando a entrar en una etapa diferente de la inteligencia artificial.