Anthropic prueba GRAM para apagar conocimientos de IA
Anthropic y AE Studio presentan GRAM, una técnica preliminar que concentra conocimientos de uso dual en módulos extraíbles dentro de un modelo de IA. En sus pruebas, permitió apagar por separado cuatro áreas, como virología y ciberseguridad, sin reducir el rendimiento general.

Anthropic y AE Studio han probado una técnica para activar o desactivar conocimientos de uso dual dentro de un modelo de IA, como los relacionados con virología o ciberseguridad, sin tener que entrenar un modelo distinto para cada caso.
La investigación todavía es preliminar: GRAM no se ha aplicado a ningún modelo de producción de Anthropic y la compañía no sabe si llegará a hacerlo. Pero plantea una forma diferente de controlar capacidades peligrosas: no solo pedirle al modelo que se niegue a responder, sino retirar físicamente la parte de sus parámetros que contiene cierto conocimiento.
El problema de las capacidades de uso dual
Un modelo avanzado de IA almacena grandes cantidades de información. Parte de ella puede servir tanto para fines beneficiosos como dañinos.
El conocimiento de ciberseguridad, por ejemplo, ayuda a corregir vulnerabilidades, pero también puede utilizarse para explotarlas. La información sobre virología puede apoyar el desarrollo de vacunas, aunque también podría ayudar a diseñar un patógeno peligroso.
Hoy, los sistemas suelen protegerse con dos capas principales:
- Entrenamiento para rechazar solicitudes dañinas.
- Clasificadores que revisan las preguntas y las respuestas en busca de contenido peligroso.
Estas medidas controlan lo que el modelo responde, pero no eliminan el conocimiento de fondo. Un atacante decidido puede intentar saltarse las barreras mediante un jailbreak, es decir, una instrucción diseñada para esquivar las restricciones.
Un interruptor dentro del modelo
GRAM significa Gradient-Routed Auxiliary Modules. La técnica añade grupos de neuronas extra a cada capa del modelo. Cada grupo funciona como un compartimento separado para una categoría de conocimiento de uso dual.
Durante el entrenamiento, el modelo aprende normalmente con textos generales. Pero cuando procesa información de una categoría concreta, como virología, solo se actualiza el módulo de virología. El resto de los parámetros queda congelado.
Así, ese conocimiento debería concentrarse en su propio módulo en lugar de repartirse por toda la red. Después, el módulo puede eliminarse para apagar la capacidad o mantenerse activo en una instalación autorizada, como un laboratorio de bioseguridad.
En sus pruebas, los investigadores separaron cuatro áreas: virología, ciberseguridad, física nuclear y un lenguaje de programación especializado. Como cada una podía encenderse o apagarse de forma independiente, un solo entrenamiento produjo 16 configuraciones posibles.
Qué ocurrió en las pruebas
Los investigadores probaron GRAM en tres escenarios, desde uno artificial hasta modelos de mayor tamaño:
- En relatos infantiles clasificados por temas, el modelo podía olvidar cualquier tema elegido y rendía casi igual que un modelo entrenado desde cero sin ese contenido.
- En una mezcla de páginas web, código y artículos científicos, eliminar un módulo retiró la capacidad correspondiente casi tan bien como no haber entrenado nunca con esos datos.
- Al probar siete tamaños de modelo, desde 50 millones hasta 5.000 millones de parámetros, GRAM igualó el rendimiento de la filtración de datos.
La eliminación de los módulos no redujo el rendimiento general en esas pruebas. Además, recuperar el conocimiento eliminado mediante un pequeño ajuste con datos maliciosos fue tan difícil como con la filtración de datos.
La comparación fue desfavorable para otra técnica conocida como unlearning, que intenta borrar información después del entrenamiento. En el experimento, bastó un ajuste relativamente pequeño para recuperar el conocimiento que supuestamente se había eliminado.
El resultado también mostró una tendencia relevante: cuanto mayor era el modelo, más amplia era la diferencia entre tener un módulo activado y desactivado, y más costoso resultaba intentar superar la protección.
Qué significa para ti
GRAM no cambia hoy el funcionamiento de Claude ni de otros modelos comerciales. No se ha probado a escala de frontera, no forma parte de un proceso de producción y las evaluaciones midieron sobre todo la predicción del siguiente token, no tareas reales como analizar una amenaza o diseñar una vacuna.
Su importancia está en el enfoque. En lugar de crear un modelo completamente nuevo para cada nivel de acceso, un desarrollador podría entrenar una sola versión y distribuir configuraciones distintas según quién la utilice.
Todavía queda una dificultad de fondo: ciertos conocimientos peligrosos pueden estar tan mezclados con la información general que resulte imposible separarlos sin afectar otras capacidades. La siguiente cuestión será comprobar si GRAM funciona en modelos mucho más grandes y en tareas reales, no solo en pruebas de laboratorio.