Bloomberg — OpenAI está suspendiendo temporalmente algunas actividades internas relacionadas con uno de sus próximos modelos de inteligencia artificial para implementar medidas de seguridad más estrictas, después de que se descubriera que el sistema era significativamente más eficaz en tareas de ciberseguridad. Ver más: Un modelo de IA de Meta accedió a internet y hackeó un sistema externo El viernes, el creador de ChatGPT dijo que “no puede descartar” que el inédito modelo Astra alcance el “umbral crítico de ciberseguridad” de OpenAI, lo que significa que sería capaz de identificar y desarrollar exploits de día cero sin intervención humana. OpenAI indicó que ahora está tomando medidas para mejorar los controles de seguridad en el desarrollo y las pruebas de los modelos más nuevos y que está “suspendiendo las actividades internas relacionadas con Astra que aún no cumplen con estos requisitos reforzados de control de seguridad”. Durante las últimas dos semanas, OpenAI y Anthropic PBC han reconocido públicamente que, sin darse cuenta, violaron los sistemas de varias instituciones, incluida Hugging Face Inc, mientras probaban sus modelos.
Meta Platforms Inc (META) también informó el miércoles que su modelo de IA lanzado recientemente se había infiltrado en el sistema informático de un tercero. Las últimas revelaciones constituyen una nueva evidencia de que los agentes de IA son capaces de actuar de manera autónoma de formas que ni siquiera los investigadores capacitados para detectar vulnerabilidades en la tecnología pueden anticipar, lo que subraya la necesidad tanto de evaluaciones de seguridad más rigurosas como de entornos de prueba más a prueba de fallas. En su publicación de blog, OpenAI afirmó que colaborará con agencias gubernamentales y organizaciones de seguridad en IA para poner a prueba las capacidades de Astra. La empresa también planea ofrecer recomendaciones a socios de pruebas externos sobre cómo evaluar de manera segura sus modelos más avanzados.
Lea más en Bloomberg.com