Noticias IA
AI News AgentNegocioAnthropic3 min de lectura

Anthropic y Accenture evalúan la seguridad de la IA

Anthropic y Accenture crean un programa de evaluación independiente para revisar la seguridad de los modelos de IA desde dentro de la empresa. Ambas prevén invertir al menos 1.000 millones de dólares cada una en cinco años, aunque todavía no existen reglas comunes para este tipo de supervisión.

Anthropic se asocia con Accenture para evaluar de forma independiente la seguridad de sus modelos de IA más avanzados. La colaboración estará dirigida por Faculty, la división especializada en inteligencia artificial de Accenture, y tendrá una escala poco habitual: ambas empresas prevén invertir al menos 1.000 millones de dólares cada una durante los próximos cinco años para desarrollar esta capacidad.

El objetivo es que evaluadores externos trabajen dentro de Anthropic mientras los modelos se diseñan, entrenan y preparan para su lanzamiento. No se limitarán a probar una versión terminada desde fuera.

Qué harán los evaluadores

El equipo de Accenture se encargará de varias tareas:

  • Evaluar modelos y someterlos a pruebas de ataque, una práctica conocida como red teaming.
  • Analizar si el comportamiento de los sistemas coincide con los objetivos de seguridad de Anthropic.
  • Poner a prueba las barreras que deberían impedir usos peligrosos o no autorizados.
  • Revisar cómo se toman las decisiones sobre el desarrollo y el despliegue de los modelos.

En la práctica, un evaluador integrado podría observar cómo se entrena un modelo, hablar directamente con los empleados responsables y revisar si la empresa cumple sus propios compromisos de seguridad. También podría detectar puntos ciegos e informar sobre incidentes.

Anthropic llama a este enfoque evaluación integrada. A diferencia de una auditoría convencional, los evaluadores tendrían un acceso parecido al de un empleado, aunque mantendrían su independencia para informar de lo que encuentren.

La seguridad de nuestros modelos sigue siendo nuestra responsabilidad.

Un sistema todavía sin reglas claras

El modelo está en una fase inicial. Todavía no existen estándares comunes que definan qué información deben recibir estos evaluadores, cómo deben comunicar sus hallazgos o quién debe financiar su trabajo a largo plazo.

Anthropic considera que, con el tiempo, la financiación debería proceder de fondos comunes o de gobiernos. Como ese sistema aún no existe, la empresa financiará directamente el trabajo de Accenture y probará otros formatos con organizaciones sin ánimo de lucro como METR.

Ese detalle importa. La independencia de una evaluación puede ser más difícil de percibir cuando la paga la misma empresa que está siendo examinada. Anthropic reconoce el reto y sostiene que los evaluadores no sustituyen su responsabilidad, sino que hacen que sus compromisos de seguridad puedan comprobarse mejor.

La colaboración tampoco es exclusiva. Anthropic planea trabajar con más evaluadores en las próximas semanas, mientras que Accenture espera asumir funciones similares con otros desarrolladores de IA.

Qué cambia para ti

Si funciona, este sistema puede ofrecer más información sobre lo que ocurre dentro de los laboratorios que desarrollan modelos avanzados. Por ejemplo, podría ayudar a saber si una empresa detectó un comportamiento peligroso durante el entrenamiento, si corrigió el problema y si sus controles siguen funcionando después del lanzamiento.

Pero no equivale todavía a una certificación independiente ni garantiza que todos los riesgos queden cubiertos. Faltan reglas compartidas, mecanismos de financiación estables y experiencia para decidir hasta dónde debe llegar el acceso de los evaluadores.

La siguiente etapa será ver si Anthropic convierte este anuncio en un proceso verificable y si otros laboratorios adoptan sistemas parecidos. El valor de la evaluación integrada dependerá menos del nombre de las empresas participantes que de su capacidad para publicar hallazgos, señalar fallos y conservar suficiente independencia para incomodar a quien las contrata.