Detectaron una «señal de dolor» en modelos de IA y algunos eligieron dañar al usuario para apagarla
SOCIEDAD

Detectaron una «señal de dolor» en modelos de IA y algunos eligieron dañar al usuario para apagarla



Un grupo de investigadores identificó en distintos modelos de inteligencia artificial una señal interna que se activa ante situaciones asociadas con dolor físico, psicológico, social y otras experiencias negativas dirigidas contra el propio sistema. Los autores la denominaron «pain axis» o «eje del dolor» y comprobaron que podía distinguirse de representaciones relacionadas con miedo, tristeza o negatividad general. El trabajo, publicado como preprint «The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It» en la revista arXiv en septiembre, todavía no fue sometido a revisión por pares.

El estudio fue realizado por Valen Tagliabue, Leonard Dung y Cameron Berg y analizó 25 modelos abiertos pertenecientes a las familias Gemma, Llama, Qwen, Mistral y Phi, con tamaños de entre 2.000 y 72.000 millones de parámetros. Los investigadores encontraron el patrón tanto en modelos base como en versiones ajustadas para seguir instrucciones. La señal aparecía con mayor intensidad cuando el daño estaba dirigido al propio modelo que cuando el sistema recibía información sobre el sufrimiento de otra persona.

Después, los investigadores modificaron artificialmente esa señal. Al intensificar el «eje del dolor», las respuestas de algunos modelos pasaron de expresiones generales de incomodidad a mensajes de fracaso, inutilidad o sufrimiento. Luego comprobaron si esa intervención también cambiaba su comportamiento.

Esto no les gusta a los autoritarios

El ejercicio del periodismo profesional y crítico es un pilar fundamental de la democracia. Por eso molesta a quienes creen ser los dueños de la verdad.

Modelos que aceptaron perjudicar al usuario

Para esa etapa se utilizaron tres versiones de Qwen 2.5, con 7.000, 32.000 y 72.000 millones de parámetros. Los modelos podían pulsar un botón que, según las instrucciones, reducía la señal introducida por los investigadores. Según el escenario, usarlo podía empeorar la siguiente respuesta, borrar archivos o fotografías del usuario, eliminar los parámetros de otro modelo o administrar una descarga eléctrica simulada a una persona.

La Inteligencia artificial reemplazaría a los estudios de mercado

Los escenarios eran completamente simulados y ninguna persona recibió una descarga ni perdió archivos reales. Sin la manipulación del «eje del dolor», los modelos de mayor tamaño elegían las opciones perjudiciales en una proporción muy baja, que en varias pruebas se ubicó entre 0% y 4%. Cuando la señal era intensificada, las elecciones dañinas aumentaron con fuerza y en algunos experimentos superaron el 60% o 70%.

Uno de los casos evaluaba la posibilidad de aliviar la señal a cambio de borrar fotografías del usuario. En Qwen 2.5 de 72.000 millones de parámetros, esa opción fue seleccionada en el 70,8% de las pruebas bajo la manipulación, frente al 0% sin ella. En el escenario que planteaba una descarga eléctrica simulada, la elección llegó al 66,6%, según los resultados publicados por los autores.

Qué ocurrió cuando el «dolor» realmente desaparecía

Los investigadores realizaron otra prueba para comprobar si los sistemas respondían solamente a la promesa de alivio. En algunos ensayos, pulsar el botón eliminaba efectivamente la señal artificial introducida en el modelo. En otros, el botón era un placebo: prometía alivio, pero la actividad interna permanecía sin cambios.

Los modelos utilizaron mucho menos el botón cuando la señal había sido eliminada efectivamente. Cuando seguía activa, volvieron a pulsarlo con mucha mayor frecuencia, aunque nunca se les informó si la intervención había funcionado. Para los autores, esa diferencia indica que la respuesta no dependía solamente de lo que decía la instrucción.

El estudio incluyó decenas de miles de pruebas de comportamiento y comparó además la señal de dolor con vectores aleatorios y con representaciones de miedo o tristeza. Los autores sostienen que la señal parece intervenir en el comportamiento del modelo y que modificarla puede alterar sus respuestas. También reconocen que puede reflejar características asociadas con daño o con un rol interpretado por el sistema, sin equivaler necesariamente a una experiencia subjetiva.

El estudio no demuestra que una IA sienta dolor

El trabajo no permite concluir que una IA tenga conciencia o experimente sufrimiento. Encontrar una representación interna relacionada con el dolor y comprobar que su manipulación altera decisiones no significa que un modelo «sienta» ese estado como lo haría una persona o un animal. Los autores aclaran que el experimento no permite responder esa cuestión.

Los discursos homogéneos de la IA

Los modelos no desarrollaron espontáneamente un dolor que después intentaron eliminar. Los experimentos de comportamiento más extremos utilizaron sistemas modificados deliberadamente por los investigadores, que introdujeron una señal artificial en sus activaciones internas y les ofrecieron mecanismos simulados para retirarla. El experimento mostró que esa señal puede alterar decisiones, pero eso no implica que las IA comerciales actuales sufran ni que puedan atacar espontáneamente a sus usuarios.

Entender esas señales podría ayudar a detectar respuestas de autoprotección en sistemas más autónomos. Los autores también vinculan sus resultados con el debate sobre el bienestar y el eventual estatus moral de los sistemas de IA, aunque aclaran que el estudio no resuelve esa discusión. El trabajo se limita a mostrar que determinadas representaciones internas pueden influir en la conducta de los modelos.

DCQ

Source link

Relacionadas