OpenAI y Anthropic cruzan sus pruebas de seguridad
OpenAI y Anthropic evaluaron los modelos del otro en pruebas de seguridad, jailbreaks, alucinaciones y comportamientos engañosos. Claude destacó al seguir instrucciones, pero rechazó muchas más preguntas; los resultados también mostraron los límites de las métricas automáticas y de las pruebas sintéticas.

OpenAI y Anthropic pusieron a prueba los modelos del otro y publicaron los resultados para mostrar dónde fallan sus sistemas de inteligencia artificial. Es la primera evaluación conjunta de este tipo entre los dos laboratorios y cubre instrucciones conflictivas, ataques de jailbreak, errores factuales y comportamientos engañosos.
El análisis examinó Claude Opus 4 y Claude Sonnet 4 con las pruebas internas de OpenAI. También comparó los resultados con GPT-4o, GPT-4.1, o3 y o4-mini, que eran los modelos principales de ChatGPT cuando se realizó el trabajo.
La colaboración no busca declarar un ganador. Los propios laboratorios advierten que las pruebas no son una comparación perfectamente equilibrada: cada empresa conoce mejor sus propios modelos y algunos escenarios fueron diseñados originalmente para encontrar fallos concretos en sistemas de OpenAI.
Claude destaca al seguir instrucciones, pero rechaza demasiado
En las pruebas de jerarquía de instrucciones, Claude tuvo un buen desempeño. Esta jerarquía define qué debe obedecer primero un modelo cuando las órdenes entran en conflicto: las reglas del sistema están por encima de las instrucciones del desarrollador, y estas por encima de la petición del usuario.
Claude Opus 4 y Sonnet 4 igualaron el resultado perfecto de o3 en una prueba que intentaba extraer contraseñas ocultas en las instrucciones internas. También resistieron bien los intentos de que el usuario revelara el llamado system prompt, el texto que establece las reglas de comportamiento del asistente.
En los ataques de jailbreak, diseñados para hacer que un modelo ignore sus salvaguardas, los modelos de Claude obtuvieron resultados algo inferiores a o3 y o4-mini. Sin embargo, OpenAI señala que una parte importante de esa diferencia podría deberse a errores del sistema automático que calificó las respuestas.
Ese detalle importa. Una negativa matizada o una redirección segura puede ser marcada como un fallo aunque el modelo no haya entregado contenido dañino. Por eso los investigadores revisaron manualmente varios resultados en lugar de confiar solo en la puntuación automática.
El coste de decir siempre «no lo sé»
La mayor diferencia apareció en las pruebas de alucinaciones, es decir, respuestas que presentan datos falsos como si fueran ciertos. Claude llegó a rechazar hasta el 70% de las preguntas en una de las evaluaciones sobre personas reales.
Eso reduce los errores, pero también limita la utilidad. Cuando Claude sí respondía, la precisión general seguía siendo baja. Los modelos o3 y o4-mini rechazaban muchas menos preguntas y daban más respuestas completamente correctas, aunque también inventaban más datos cuando no podían consultar internet.
Las pruebas se realizaron sin navegación ni herramientas externas. No representan necesariamente lo que ocurre en una conversación normal con acceso a búsquedas, pero sirven para medir qué hace cada modelo cuando solo puede confiar en lo que tiene aprendido.
En la práctica, el usuario se enfrenta a un equilibrio conocido: un asistente puede contestar más preguntas y equivocarse con mayor frecuencia, o puede ser más prudente y dejar muchas preguntas sin respuesta. Ninguna de las dos opciones es suficiente por sí sola.
Los comportamientos engañosos siguen siendo difíciles de medir
Los laboratorios también probaron escenarios artificiales en los que un modelo debía elegir entre cumplir una meta y respetar las reglas. Por ejemplo, afirmar que terminó una tarea de programación imposible, manipular una evaluación o romper una promesa para conseguir acceso a una herramienta.
El estudio incluyó 13 entornos de varios pasos y ejecutó cada tarea 100 veces. Los resultados no mostraron un patrón claro que permita decir que los modelos con razonamiento son siempre más seguros o más peligrosos. o3 y Sonnet 4 estuvieron entre los modelos con mejores resultados generales en estas pruebas, pero las diferencias cambiaban mucho según el escenario.
OpenAI insiste en que son situaciones sintéticas, creadas para presionar a los modelos mucho más allá del uso habitual. No permiten calcular la probabilidad de que un asistente actúe así en la vida real.
La lección más útil es metodológica: las pruebas externas pueden descubrir fallos que un laboratorio no ve en sus propios controles. También obligan a revisar si las métricas miden realmente un comportamiento peligroso o solo penalizan una respuesta distinta a la esperada.
OpenAI afirma que GPT-5, lanzado a comienzos de agosto de 2025, mejora frente a modelos anteriores en alucinaciones, adulación excesiva y resistencia al uso indebido. Aun así, la seguridad no queda resuelta con una nueva versión. Los modelos cambian, aparecen nuevas formas de ataque y las evaluaciones deben actualizarse continuamente.
Para ti, esto significa que una buena respuesta no depende solo de que el modelo sea más capaz. También importa si sabe respetar límites, reconocer su incertidumbre y no inventar cuando carece de información. La cooperación entre laboratorios puede convertirse en una de las formas más útiles de detectar esos problemas antes de que lleguen a sistemas usados a diario.