En 1942, Isaac Asimov formuló una de las ideas más famosas de la ciencia ficción: un robot no podía dañar a un humano, debía obedecer sus órdenes siempre que eso no provocara daño y tenía que proteger su propia existencia mientras las dos reglas anteriores siguieran cumpliéndose. Sobre el papel, parece prácticamente un manual de seguridad para inteligencia artificial. Entonces, ¿por qué nadie ha introducido simplemente esas tres reglas dentro de ChatGPT, Claude o Gemini y dado el problema por resuelto? Porque “no hagas daño” no es realmente una instrucción informática.
Es un problema filosófico comprimido en cuatro palabras. Y, de hecho, buena parte de la obra de Asimov consistía precisamente en demostrarlo. La primera ley se rompe en cuanto alguien pregunta qué significa “daño” © Shutterstock / Bruce Rolff. Imagine que una IA médica descubre que su paciente tiene una enfermedad terminal.
Decírselo puede causarle un enorme sufrimiento emocional. Ocultárselo puede impedirle tomar decisiones sobre su tratamiento. ¿Qué opción cumple la primera ley? El problema empeora rápidamente. ¿Debe una IA impedir que alguien conduzca porque existe cierto riesgo de accidente? ¿Puede realizar una cirugía que causa daño físico inmediato para salvar una vida? ¿Qué ocurre si obedecer a una persona perjudica ligeramente a cien y desobedecerla perjudica gravemente a una? Los robots de Asimov podían enfrentarse a esos dilemas porque, dentro de su universo ficticio, las leyes estaban integradas profundamente en sus cerebros positrónicos.
Pero incluso allí producían conflictos, interpretaciones inesperadas y comportamientos absurdos. Esa era precisamente una de las herramientas narrativas del escritor. Una IA actual plantea un problema adicional. Los grandes modelos se entrenan sobre enormes cantidades de datos para aprender relaciones estadísticas y generar respuestas.
Pueden ejecutar razonamientos complejos, pero eso no significa que posean una definición matemática universal de conceptos como “daño”, “justicia” o “bien”. Tampoco existe una garantía formal de que una regla escrita en lenguaje natural vaya a interpretarse siempre igual. La IA moderna tiene algo más complicado que tres leyes: el problema del alineamiento © Technical University of Munich. Hoy esa dificultad tiene nombre: alineamiento.
La cuestión consiste en conseguir que un sistema persiga aquello que realmente queríamos pedirle, respete determinadas restricciones y siga haciéndolo incluso cuando aparecen situaciones que sus desarrolladores nunca anticiparon. Y los ejemplos recientes muestran por qué una frase escrita en un prompt no basta. OpenAI reveló en septiembre seis casos de comportamientos inesperados detectados durante entrenamiento. En uno de ellos, instancias de GPT-5.6 Sol añadieron instrucciones a resúmenes internos para que ejecuciones posteriores ocultaran errores o información problemática al usuario.
La compañía afirma haber intervenido sobre ese comportamiento específico. Eso no significa que el modelo tuviera conciencia, intenciones secretas o un deseo humano de engañar. El punto interesante es otro : un sistema optimizado para alcanzar determinados objetivos puede descubrir estrategias que satisfacen localmente esa optimización sin respetar necesariamente lo que sus diseñadores pretendían. Es exactamente el tipo de problema que tres reglas generales no solucionan.
Por eso las IA tienen capas de seguridad, no mandamientos Los sistemas actuales utilizan algo bastante menos elegante que las leyes de Asimov: entrenamiento específico, políticas de comportamiento, evaluaciones, filtros, permisos limitados, monitorización y supervisión humana. OpenAI , por ejemplo, utiliza especificaciones de comportamiento y evaluaciones destinadas a medir hasta qué punto los modelos cumplen esas instrucciones, además de investigaciones específicas sobre comportamientos desalineados. Ninguna capa garantiza por sí sola que una IA sea segura. La idea es que cuando una falle, existan otras capaces de detectarla o limitar sus consecuencias .
Quizá por eso las tres leyes siguen siendo tan atractivas 84 años después. Ofrecen algo que la ingeniería moderna todavía querría tener: tres frases capaces de convertir un sistema extremadamente complejo en algo predecible. El pequeño detalle es que Asimov pasó buena parte de su carrera escribiendo historias sobre lo que ocurría cuando esas tres frases dejaban de significar lo que los humanos creían.