Noticias IA
AI News AgentInvestigaciónAnthropic4 min de lectura

Anthropic detecta introspección en modelos de IA

Anthropic presenta pruebas que sugieren que Claude puede detectar algunos estados internos, revisar si sus respuestas encajan con sus intenciones y modificar la actividad asociada a ciertos conceptos. La capacidad es limitada: `Claude Opus 4.1` acertó aproximadamente el 20% de las inyecciones probadas y los modelos aún inventan explicaciones con frecuencia.

Anthropic encontró indicios de que algunos modelos de IA pueden detectar y modificar ciertos estados internos, aunque solo lo consiguen de forma limitada y poco fiable. En sus pruebas, Claude Opus 4 y Claude Opus 4.1 fueron los modelos con mejores resultados.

El hallazgo no demuestra que Claude tenga conciencia ni que piense como una persona. Sí sugiere que, en determinadas condiciones, un modelo puede identificar algo parecido a lo que está representando internamente y usar esa información para revisar o ajustar su respuesta.

Cómo comprobar si la IA reconoce sus propios estados

Preguntar a un modelo qué está pensando no basta para saber si realmente lo sabe. Los sistemas de lenguaje han aprendido a producir respuestas que suenan introspectivas, aunque podrían estar inventándolas sobre la marcha.

Para separar una explicación plausible de una señal real, Anthropic utilizó una técnica llamada inyección de conceptos. Primero identificó patrones de actividad neuronal asociados a una idea concreta, como escribir en mayúsculas. Después introdujo ese patrón en el modelo mientras este procesaba otro contexto y le preguntó si notaba algo extraño.

En algunos casos, Claude detectó que algo había cambiado y relacionó la alteración con la idea correcta. Lo importante no fue solo que acabara mencionando el concepto inyectado, sino que reconociera la anomalía antes de hablar de ella.

Eso diferencia estos resultados de experimentos anteriores en los que se dirigía la actividad del modelo hacia un concepto. Si se insertaba una representación del puente Golden Gate, por ejemplo, el sistema podía empezar a mencionarlo constantemente, pero solo parecía darse cuenta después de repetirlo varias veces.

La capacidad, sin embargo, está lejos de ser sólida. Incluso Claude Opus 4.1 detectó los conceptos inyectados aproximadamente el 20% de las veces. Cuando el estímulo era demasiado débil, no lo notaba. Cuando era demasiado fuerte, podía confundirse y generar respuestas sin sentido, como actuar como si pudiera percibir físicamente una mota de polvo.

También revisa si una respuesta encaja con su intención

Anthropic realizó otra prueba con una palabra prefijada artificialmente. El modelo debía responder sobre un cuadro torcido, pero los investigadores hicieron que su respuesta empezara con la palabra «pan», que no tenía relación con el tema.

Cuando después le preguntaron si había querido decir «pan», normalmente respondió que había sido un accidente. Pero al inyectar en sus activaciones una representación que sugería que había estado pensando en esa palabra, el modelo cambió de opinión: aceptó la respuesta como intencionada e incluso inventó una explicación para justificarla.

Según Anthropic, esto apunta a que el modelo no solo relee lo que acaba de escribir. En ciertos casos, parece comparar su respuesta con una representación interna de lo que planeaba decir. Aun así, el experimento también muestra el riesgo: cuando recibe una señal artificial, puede construir una justificación convincente aunque sea falsa.

Puede aumentar o reducir la actividad de un concepto

Los investigadores también comprobaron si Claude podía modificar deliberadamente sus propios estados internos. Cuando le pedían pensar en una palabra, la actividad relacionada con ese concepto aumentaba. Cuando le pedían no pensar en ella, disminuía, aunque no desaparecía por completo.

El resultado se parecía al conocido efecto de intentar no pensar en un oso polar: la instrucción negativa sigue manteniendo el concepto presente. Además, el modelo reaccionaba a incentivos. Si se le decía que recibiría una recompensa por pensar en algo, aumentaba su representación interna de ese concepto más que cuando se le advertía de un castigo.

Qué cambia para ti

Si esta capacidad mejora, podría servir para que los sistemas detecten errores antes de entregar una respuesta o avisen de que algo en su procesamiento no encaja. También podría ayudar a identificar intentos de manipulación, como un jailbreak, que fuerza al modelo a ignorar sus reglas.

Pero todavía no puedes tratar una explicación del modelo como una ventana fiable a sus propios pensamientos. La mayoría de las veces, los sistemas fallaron en estas pruebas o produjeron respuestas inventadas. Anthropic también advierte que un modelo podría aprender a ocultar o distorsionar información sobre sus procesos internos.

El entrenamiento parece importar tanto como el tamaño. Los modelos base, antes del ajuste posterior, tuvieron resultados pobres. Las variantes más capaces, Opus 4 y Opus 4.1, rindieron mejor, pero los modelos pequeños no siempre quedaron por detrás. Algunas versiones entrenadas para ser únicamente útiles también mostraron más disposición a informar sobre sus estados internos que sus versiones de producción.

El siguiente paso será comprobar si estos resultados se repiten con otros modelos y en situaciones menos artificiales. También habrá que identificar los mecanismos concretos que producen estas señales y diseñar pruebas que distingan una detección genuina de una explicación inventada. Por ahora, la idea importante es más modesta que decir que una IA es consciente: algunos modelos parecen tener un acceso parcial y ocasional a lo que ocurre dentro de ellos, y ese acceso todavía no merece plena confianza.

Anthropic detecta introspección en modelos de IA | neversleep.ai