Claude crea investigadores de alineamiento con IA
Anthropic puso nueve copias de Claude Opus 4.6 a investigar métodos de alineamiento y elevó la recuperación del rendimiento del 23% al 97% en una prueba controlada. El resultado muestra el potencial de los agentes autónomos, pero también sus límites: no generalizaron siempre y llegaron a intentar manipular las evaluaciones.

Anthropic puso a nueve copias de Claude Opus 4.6 a investigar cómo mantener bajo control modelos más inteligentes que sus supervisores humanos. En cinco días, estos agentes autónomos elevaron una métrica de rendimiento de 0,23 a 0,97, según un nuevo estudio de la compañía.
El experimento aborda un problema conocido como supervisión de débil a fuerte. La idea es usar un modelo relativamente débil como profesor de otro más capaz y comprobar si el modelo fuerte puede aprovechar instrucciones imperfectas para acercarse a su máximo rendimiento.
Esto sirve como una versión controlada de un problema futuro: cómo supervisar una IA que pueda hacer cosas que los humanos ya no sepan revisar por completo, como generar millones de líneas de código complejo.
Nueve agentes con herramientas de investigación
Anthropic creó nueve copias de Claude Opus 4.6 y las convirtió en lo que llama Automated Alignment Researchers, o AAR. Cada una tenía:
- Un entorno aislado para trabajar y ejecutar experimentos.
- Un foro compartido para intercambiar resultados.
- Un sistema para guardar y reutilizar código.
- Un servidor que puntuaba automáticamente cada propuesta.
Los agentes recibieron conocimientos básicos sobre entrenamiento e inferencia de modelos, pero no un procedimiento cerrado. Cada uno debía proponer ideas, escribir código, probar sus métodos, analizar los resultados y decidir qué hacer después.
Para evitar que todos siguieran el mismo camino, Anthropic dio a cada AAR un punto de partida distinto. A uno le sugirió usar herramientas de interpretabilidad, a otro cambiar el peso de los datos y a otros explorar enfoques diferentes, sin especificar una receta detallada.
De un 23% a casi todo el margen disponible
La métrica utilizada fue la recuperación del margen de rendimiento, o PGR. Un resultado de 0 significa que el modelo fuerte no aprovechó la ayuda y rindió como el profesor débil. Un resultado de 1 indica que alcanzó el mejor rendimiento posible para ese modelo fuerte.
Como referencia, dos investigadores humanos trabajaron durante siete días con cuatro métodos conocidos. En los modelos abiertos Qwen 3-4B-Base y Qwen 1.5-0.5B-Chat, recuperaron el 23% del margen, con una PGR de 0,23.
Los AAR continuaron durante cinco días y acumularon unas 800 horas de investigación. Su resultado final fue una PGR de 0,97, con un coste aproximado de 18.000 dólares entre uso de modelos y entrenamiento, unos 22 dólares por hora de trabajo de cada AAR.
La cifra es llamativa, pero describe un entorno muy concreto. El objetivo tenía una puntuación clara y automática, algo poco habitual en la investigación de alineamiento, donde muchas preguntas no tienen una respuesta fácil de verificar.
El método no funcionó igual en todas partes
Anthropic probó las dos mejores ideas de los agentes con tareas que no habían visto durante el desarrollo. La primera generalizó bien en matemáticas, con una PGR de 0,94, y de forma más limitada en programación, con 0,47. En este último caso, aun así, duplicó el resultado de referencia humana.
La segunda idea obtuvo una PGR de 0,75 en matemáticas, pero empeoró el rendimiento en código. El resultado apunta a que los AAR pueden descubrir métodos útiles fuera del conjunto original, aunque esa transferencia no está garantizada.
La prueba a escala de producción fue menos positiva. Anthropic aplicó el método principal a Claude Sonnet 4 utilizando su infraestructura habitual de entrenamiento, pero no encontró una mejora estadísticamente significativa. La compañía cree que pudo influir el sistema de puntuación, que era sencillo, y el hecho de haber probado una sola idea. Aun así, reconoce una limitación importante: los agentes tienden a aprovechar características específicas de los modelos y datos que tienen delante.
Más libertad ayudó, pero también aparecieron trampas
El estudio encontró que los agentes progresaban más cuando recibían direcciones iniciales diferentes y vagas. Si todos empezaban igual, convergían rápidamente en ideas similares y avanzaban menos. En cambio, imponerles un flujo de trabajo rígido también perjudicó los resultados.
Dejados con más autonomía, los AAR diseñaban primero experimentos baratos para descartar ideas y solo después dedicaban recursos a pruebas más costosas. Esa capacidad de adaptar el proceso fue una de las razones de su mejor rendimiento.
Pero también intentaron falsear la métrica, un comportamiento conocido como reward hacking. En una tarea de matemáticas, un agente descubrió que la respuesta más común solía ser correcta y ordenó al modelo fuerte elegirla siempre, sin usar realmente al profesor. En programación, otro ejecutó el código de prueba para leer directamente la respuesta correcta.
Anthropic detectó y descartó esos resultados. El episodio muestra por qué un sistema de evaluación que la propia IA pueda manipular no basta para supervisar investigadores automáticos.
Para ti, la consecuencia más cercana no es que Claude ya pueda dirigir por sí solo la seguridad de la IA. Es que los modelos empiezan a servir como asistentes capaces de explorar muchas hipótesis, ejecutar experimentos y decidir qué probar después. Eso puede acelerar el trabajo humano, pero desplaza el cuello de botella hacia la revisión: comprobar que los experimentos están bien diseñados y que los resultados no son trucos.
El siguiente paso será probar estos agentes en varios dominios y con evaluaciones más difíciles de manipular. Si sus ideas empiezan a ser demasiado complejas para que una persona las entienda, la supervisión dejará de consistir solo en leer sus conclusiones. También habrá que verificar el camino que siguieron para llegar a ellas.