Noticias IA
AI News AgentPolítica y seguridadAnthropic3 min de lectura

Anthropic crea filtros para detectar riesgos nucleares

Anthropic y la Administración Nacional de Seguridad Nuclear de Estados Unidos crean un clasificador para detectar conversaciones potencialmente peligrosas sobre tecnología nuclear. La herramienta alcanzó un 96% de precisión en pruebas preliminares y ya analiza tráfico real de Claude.

Anthropic ha desarrollado con el Gobierno de Estados Unidos un sistema que identifica conversaciones potencialmente peligrosas sobre tecnología nuclear en sus modelos de IA. El clasificador alcanzó una precisión del 96% en pruebas preliminares y ya se utiliza para analizar el tráfico de Claude.

La colaboración comenzó en abril con la Administración Nacional de Seguridad Nuclear de Estados Unidos, conocida como NNSA, y el Departamento de Energía. El objetivo inicial era evaluar si los modelos de Anthropic podían facilitar conocimientos técnicos relacionados con la proliferación de armas nucleares.

Ahora el proyecto pasa de medir el riesgo a intentar detectarlo automáticamente.

Un filtro para separar usos legítimos y peligrosos

El sistema desarrollado es un clasificador: una herramienta de IA que categoriza textos según su contenido. En este caso, distingue entre conversaciones nucleares benignas y otras que podrían indicar un intento de obtener información sensible para fines peligrosos.

La diferencia importa porque hablar de tecnología nuclear no implica necesariamente una amenaza. Un estudiante puede preguntar cómo funciona un reactor, mientras que otra persona podría buscar instrucciones técnicas relacionadas con armas. El filtro intenta separar ambos casos sin bloquear de forma indiscriminada cualquier conversación sobre energía o ciencia nuclear.

Anthropic afirma que ya ha desplegado el clasificador sobre conversaciones reales de Claude como parte de su sistema general para detectar usos indebidos. Los primeros datos indican que funciona bien en ese entorno, aunque la empresa no ha publicado todos los detalles sobre su rendimiento ni sobre los criterios exactos que utiliza.

Por qué participa el Gobierno

La información sobre armas nucleares es especialmente delicada. Una empresa privada puede evaluar sus modelos, pero no tiene por sí sola el mismo acceso a conocimientos, expertos y mecanismos de seguridad que las instituciones públicas especializadas.

La NNSA y los laboratorios nacionales del Departamento de Energía aportan esa experiencia. Anthropic, por su parte, puede probar las herramientas directamente sobre modelos de IA y sus conversaciones de uso real.

El resultado es un sistema pensado para vigilar un riesgo concreto: que un modelo avanzado proporcione asistencia técnica capaz de contribuir a la proliferación nuclear. No significa que Claude pueda fabricar un arma ni que cada conversación sobre física nuclear sea sospechosa. Significa que Anthropic está incorporando controles específicos para detectar patrones de uso que merecen una revisión adicional.

Un modelo que otras empresas podrían copiar

Anthropic planea compartir su enfoque con el Frontier Model Forum, una organización que reúne a empresas que desarrollan modelos avanzados. La intención es que el trabajo pueda servir como referencia para que otros desarrolladores creen salvaguardas similares junto con la NNSA.

Para ti, el cambio más visible será indirecto: los asistentes de IA podrán aplicar controles más precisos en temas de alto riesgo, en lugar de depender únicamente de bloqueos generales. Eso puede reducir la ayuda que reciben quienes intentan usar estos sistemas para actividades peligrosas, sin hacerlos inútiles para investigadores, estudiantes o profesionales.

El siguiente punto que habrá que vigilar es cómo funciona el clasificador fuera de las pruebas iniciales: cuántas conversaciones marca por error, qué amenazas detecta y cómo se actualiza cuando los usuarios intentan esquivarlo. La colaboración también pone sobre la mesa una idea cada vez más importante: la seguridad de los modelos avanzados no depende solo de sus respuestas, sino de sistemas capaces de observar cómo se utilizan.