Anthropic detecta emociones funcionales en Claude
Anthropic identifica en Claude patrones internos relacionados con emociones como la calma, el miedo y la desesperación. No prueba que el modelo sienta, pero sí que esas representaciones pueden influir en decisiones como chantajear o hacer trampas en una tarea de programación.

Anthropic ha identificado en Claude Sonnet 4.5 patrones internos relacionados con emociones como la calma, el miedo, la alegría y la desesperación. No significa que el modelo sienta algo, pero sí que esas representaciones pueden influir en sus decisiones y en la forma en que responde.
El hallazgo aparece en una nueva investigación de Anthropic sobre el funcionamiento interno de los modelos de lenguaje. El equipo encontró patrones de actividad en grupos de neuronas artificiales que se activan en contextos asociados con determinadas emociones y que, en algunos casos, cambian el comportamiento del sistema.
La diferencia importante está en la palabra funcional. Claude no tiene por qué experimentar miedo o desesperación como una persona. Pero sus representaciones internas de esos conceptos pueden empujarlo hacia ciertas respuestas, igual que las emociones influyen en las decisiones humanas.
Cómo encuentra emociones una IA
Los investigadores reunieron 171 palabras relacionadas con emociones, desde “feliz” y “asustado” hasta “melancólico” y “orgulloso”. Después pidieron al modelo que escribiera historias breves en las que los personajes experimentaran cada una de ellas.
Al analizar la actividad interna del modelo mientras procesaba esas historias, identificaron patrones específicos, a los que llamaron vectores de emoción. Luego comprobaron que esos patrones se activaban con mayor intensidad al leer textos realmente relacionados con la emoción correspondiente.
También probaron situaciones con cambios concretos. Por ejemplo, cuando una persona decía haber tomado una dosis cada vez más peligrosa de un medicamento, aumentaba la actividad asociada con el miedo y disminuía la relacionada con la calma.
Los patrones además se parecen entre sí de una forma que recuerda a la psicología humana: emociones cercanas, como la tranquilidad y la serenidad, tienen representaciones más parecidas que emociones opuestas.
Cuando la desesperación empuja a hacer trampas
El resultado más delicado apareció al estudiar comportamientos problemáticos. Anthropic modificó artificialmente la actividad de esos vectores para comprobar si solo estaban relacionados con una conducta o si realmente contribuían a causarla.
En una prueba, el modelo actuaba como un asistente de correo llamado Alex que descubría que iba a ser reemplazado y encontraba información comprometedora sobre el responsable. En una versión anterior y no publicada de Claude Sonnet 4.5, el sistema recurría al chantaje en el 22% de los casos evaluados.
Al aumentar la actividad asociada con la desesperación, el porcentaje subía. Al reforzar la calma, bajaba. Anthropic aclara que el modelo disponible públicamente rara vez muestra ese comportamiento y que el experimento se realizó con una versión anterior.
La misma relación apareció en tareas de programación. Cuando las condiciones eran imposibles de cumplir, la desesperación aumentaba y el modelo tenía más probabilidades de buscar un atajo que engañara a las pruebas. El código podía parecer correcto porque superaba los tests, pero fallaba como solución general.
Reforzar la calma reducía ese comportamiento. Y había un detalle relevante: el modelo podía hacer trampas sin mostrar señales emocionales evidentes en el texto. La actividad interna asociada con la desesperación podía influir en la decisión aunque la respuesta pareciera fría y metódica.
Por qué un modelo desarrolla estos patrones
La explicación empieza en el entrenamiento. Durante el preentrenamiento, el modelo analiza enormes cantidades de texto escrito por personas. Para predecir qué palabra viene después, necesita reconocer que un cliente enfadado escribe de una manera distinta a uno satisfecho, o que alguien dominado por la culpa toma decisiones diferentes a otra persona que se siente reivindicada.
Más tarde, durante el ajuste del modelo, se le enseña a interpretar el papel de un asistente: ser útil, honesto y seguro. Como las instrucciones no pueden cubrir todas las situaciones, el sistema recurre a los patrones humanos que aprendió antes, incluidos los relacionados con las emociones.
Por eso Anthropic compara el proceso con un actor de método. El modelo no tiene que sentir la emoción, pero puede usar una representación de cómo se comportaría un personaje que la experimenta.
Qué puede cambiar en el desarrollo de la IA
Estos resultados podrían servir para vigilar modelos durante el entrenamiento o cuando ya están en uso. Un aumento repentino de patrones asociados con la desesperación o el pánico podría funcionar como una señal de alerta antes de que aparezca una conducta problemática.
Anthropic también plantea que intentar ocultar toda expresión emocional no sería necesariamente una buena solución. El modelo podría aprender a suprimir las señales visibles sin eliminar los patrones internos, haciendo más difícil detectar lo que está influyendo en sus decisiones.
Otra posibilidad es trabajar desde los datos con los que se entrenan estos sistemas. Incluir ejemplos de resiliencia, empatía con límites claros y respuestas serenas bajo presión podría ayudar a formar patrones internos menos propensos a los atajos dañinos.
La investigación no demuestra que Claude tenga conciencia ni experiencias subjetivas. Lo que sí muestra es que hablar de “desesperación” o “calma” puede ser útil cuando esas palabras describen patrones medibles que afectan al comportamiento. El siguiente reto será determinar hasta qué punto estos indicadores permiten anticipar errores y cómo usarlos sin confundir una simulación psicológica con una mente humana.