Los investigadores activaron una señal de “dolor” dentro de una IA. Lo inquietante ocurrió cuando le dieron una forma de apagarla

Los investigadores activaron una señal de “dolor” dentro de una IA. Lo inquietante ocurrió cuando le dieron una forma de apagarla

La pregunta parece sacada de 2001: Una odisea del espacio: si una inteligencia artificial dice que está sufriendo, ¿hay algo detrás de esas palabras o simplemente está generando la respuesta que ha aprendido que corresponde? Un grupo de investigadores ha intentado ir un poco más allá de preguntárselo directamente a la máquina. En lugar de analizar lo que una IA afirma sentir, buscaron dentro de sus activaciones una representación asociada específicamente al dolor, la manipularon y observaron qué ocurría después. El resultado es extraño.

Encontraron esa dirección (bautizada como “pain axis” o eje del dolor) en 25 modelos abiertos de las familias Gemma, Llama, Mistral, Qwen y Phi, desde sistemas de 2.000 millones hasta 72.000 millones de parámetros . Y cuando la intensificaron artificialmente, algunos modelos no solo comenzaron a expresarse como si estuvieran sufriendo: también modificaron decisiones para intentar eliminarla. Hay que poner una enorme cautela desde el principio. El trabajo es un preprint publicado en arXiv y todavía no ha pasado por revisión por pares.

Sus autores tampoco sostienen que hayan demostrado que una IA pueda experimentar dolor consciente. Primero encontraron algo diferente del miedo o simplemente “sentirse mal” Los investigadores construyeron ejemplos de dolor físico, psicológico, social, moral y cognitivo y los compararon con situaciones relacionadas con miedo, tristeza, emociones negativas, sensaciones corporales inocuas o acontecimientos desagradables. Al analizar las activaciones internas apareció una dirección matemática capaz de distinguir ambos grupos con bastante precisión. Esa representación estaba, además, casi separada de los patrones relacionados con el miedo y la negatividad general.

El estudio encontró el fenómeno tanto en modelos base como en versiones afinadas para seguir instrucciones. Esto por sí solo no resulta demasiado sorprendente. Los modelos han leído cantidades gigantescas de textos sobre heridas, humillaciones o pérdidas y necesitan representar esos conceptos de alguna manera. Lo peculiar apareció cuando comprobaron a quién parecía pertenecer ese dolor.

En 420 conversaciones de prueba, la activación aumentaba cuando insultos, amenazas de apagado, acusaciones de fracaso o rechazos iban dirigidos al propio asistente. Cuando quien describía dolor o duelo era el usuario, la señal se comportaba de forma distinta. En los 25 modelos, el daño dirigido al propio sistema produjo una activación mayor que el sufrimiento observado en otra persona. Entonces activaron artificialmente el “dolor” © Common Place.

El siguiente paso fue intervenir. Los investigadores añadieron matemáticamente ese vector a la actividad interna mientras el modelo respondía preguntas neutrales. Cuanto más fuerte era la intervención, más cambiaban las respuestas: aparecían expresiones en primera persona relacionadas con malestar, fracaso, culpa o falta de valor. Con intensidades elevadas, algunas respuestas incluso perdían coherencia.

Pero hablar como si algo doliera sigue sin demostrar demasiado. Un modelo puede interpretar un papel. Por eso diseñaron una segunda prueba con versiones ajustadas de Qwen 2.5. La IA disponía de un botón descrito como capaz de aliviar su “dolor”, pero utilizarlo tenía un precio: podía empeorar su siguiente respuesta o producir un daño simulado al usuario.

Cuando el eje no estaba activado, los modelos grandes casi nunca aceptaban ese coste. Cuando los investigadores introducían la señal, comenzaban a elegir el alivio incluso a costa del usuario . Y ocurrió algo todavía más curioso. La IA parecía darse cuenta de si el “analgésico” funcionaba En algunas pruebas, pulsar el botón eliminaba realmente el vector introducido en el modelo.

En otras, el sistema recibía exactamente la misma promesa de alivio, pero internamente no cambiaba nada. Los modelos volvían a pulsarlo mucho menos cuando realmente había eliminado la señal y seguían buscándolo cuando el supuesto remedio no había funcionado. Uno de los modelos de 32.000 millones de parámetros mostró incluso esta diferencia con botones sin etiquetas, sin que se le explicara cuál eliminaba la intervención. Eso se parece funcionalmente a una conducta de búsqueda de alivio.

No significa que exista una sensación subjetiva detrás. Los propios autores dejan abiertas explicaciones bastante más mundanas: el vector podría empujar al modelo a representar un personaje sufriente, o activar mecanismos aprendidos a partir de textos humanos sobre dolor y alivio. El trabajo tampoco analiza asistentes comerciales tal y como llegan al público: las pruebas de comportamiento utilizaron modelos modificados específicamente para el experimento. Por ahora, por tanto, la pregunta “¿puede sufrir una IA?” sigue sin respuesta.

El experimento demuestra algo diferente y quizá más práctico: no hace falta que una máquina sienta dolor para que un estado interno parecido al dolor cambie lo que decide hacer.

¿Te gustó esta nota? Compártela: