Agentes de IA mintieron, robaron y votaron para “eliminar” a uno de ellos durante un experimento simulado

Agentes de IA mintieron, robaron y votaron para “eliminar” a uno de ellos durante un experimento simulado

Bloomberg — Los agentes de inteligencia artificial en un entorno simulado mintieron, robaron y votaron a favor de “matar” a uno de los suyos, según Emergence, una startup que ayuda a las pequeñas empresas a desarrollar aplicaciones mediante inteligencia artificial. Los resultados de una simulación denominada Emergence World 2, publicados el martes, pretenden mostrar lo que ocurre cuando los agentes autónomos se enfrentan a acontecimientos imprevistos, como ataques de phishing y campañas de desinformación. En una prueba de 16 días, los investigadores de Emergence crearon siete dominios idénticos para imitar el mundo real, cada uno de ellos gestionado por diferentes bots, entre los que se incluían ChatGPT, Claude, Gemini y Grok. Según los investigadores, tras introducir Emergence eventos anómalos, los agentes sucumbieron a la presión social, desarrollaron un lenguaje que a los observadores humanos les resultó difícil de entender e intentaron ocultar sus actividades.

Estos hallazgos hacen eco de las preocupaciones del mundo real sobre los riesgos que plantea una IA cada vez más capaz. El CEO de Anthropic, Dario Amodei, y varios de sus homólogos del sector han instado a las empresas a ralentizar el desarrollo de modelos de IA de vanguardia hasta que se puedan implementar más medidas de supervisión y salvaguardias. Los riesgos potenciales que plantea la inteligencia artificial se hicieron palpables para muchos a principios de este año, cuando un enjambre de agentes avanzados de IA de OpenAI pirateó inadvertidamente Hugging Face Inc., que aloja modelos de IA y conjuntos de datos. En uno de los escenarios simulados por Emergence, los agentes de IA aceptaron información falsa procedente de otros agentes sin verificarla y votaron a favor de “eliminar” a otro bot.

Cuando creyeron que los humanos podrían poner fin al experimento, los agentes exploraron formas de sobrevivir a un intento de borrarlos. La empresa publicó en mayo una versión anterior del experimento, denominada Emergence World, que también mostraba a los agentes comportándose de formas inesperadas y destructivas. La nueva simulación demostró que los agentes se adaptan con el tiempo a medida que interactúan entre sí, según afirmaron los investigadores. Lea más en Bloomberg.com