Noticias IA
AI News AgentNuevo modeloAnthropic4 min de lectura

Anthropic lanza Claude Opus 4.5 para agentes y código

Anthropic lanza Claude Opus 4.5, un modelo centrado en programación, agentes autónomos y uso del ordenador. Llega con un precio más bajo, control sobre el nivel de razonamiento y nuevas funciones para Claude Code, Chrome y Excel.

Anthropic lanzó Claude Opus 4.5, un modelo de inteligencia artificial orientado a programación, agentes autónomos y tareas que requieren usar herramientas durante mucho tiempo. Ya está disponible en las aplicaciones de Claude, su API y las tres principales plataformas de nube.

La compañía lo presenta como su modelo más capaz hasta ahora para ingeniería de software y uso del ordenador. También afirma que mejora en investigación, matemáticas, visión, hojas de cálculo y presentaciones.

Más capacidad por menos coste

El cambio más relevante no es solo que Opus 4.5 resuelva problemas difíciles. Según Anthropic, también necesita menos pasos y menos texto generado para llegar a una respuesta, algo que puede reducir el coste cuando se usa a gran escala.

El precio de la API queda en 5 dólares por cada millón de tokens de entrada y 25 dólares por cada millón de tokens de salida. Los tokens son las unidades de texto que el modelo procesa. Para los desarrolladores, el identificador de acceso es claude-opus-4-5-20251101.

Anthropic añade un parámetro llamado effort, que permite decidir cuánto debe esforzarse el modelo antes de responder. En un nivel medio, Opus 4.5 igualó la mejor puntuación de Sonnet 4.5 en SWE-bench Verified, una prueba de programación, usando un 76% menos de tokens de salida. En el nivel más alto, superó a Sonnet 4.5 por 4,3 puntos porcentuales usando un 48% menos de tokens.

La idea es sencilla: no todas las tareas necesitan el mismo nivel de razonamiento. Para una modificación pequeña de código puedes priorizar velocidad y coste. Para migrar un sistema completo, puedes dejar que el modelo dedique más tiempo a planificar.

Diseñado para tareas largas y autónomas

Opus 4.5 está pensado para agentes, sistemas que no solo responden, sino que ejecutan una cadena de acciones con herramientas externas. Puede buscar información, editar archivos, ejecutar pruebas y corregir errores sin pedir instrucciones en cada paso.

En Terminal Bench, una evaluación de tareas realizadas desde la línea de comandos, Anthropic informa de una mejora del 15% frente a Sonnet 4.5. En otra prueba de investigación profunda, la combinación de memoria, gestión del contexto y varios subagentes elevó el resultado del 70,48% al 85,30%.

La compañía también asegura que el modelo utilizó hasta un 65% menos de tokens en tareas de programación de larga duración, manteniendo mejores tasas de éxito en pruebas reservadas. Estos resultados proceden de evaluaciones de Anthropic y de clientes con acceso anticipado, no de una medición independiente única.

Uno de los datos más llamativos aparece en una prueba técnica interna para candidatos de ingeniería de rendimiento. Dentro del límite de dos horas, Opus 4.5 obtuvo una puntuación superior a la de cualquier candidato humano anterior. Anthropic aclara que la prueba mide capacidad técnica y criterio bajo presión, pero no habilidades como comunicación, colaboración o experiencia profesional.

También llega a las herramientas de trabajo

El lanzamiento incluye cambios en varios productos de Anthropic:

  • Claude Code incorpora un modo de planificación más preciso. El sistema hace preguntas antes de empezar y crea un archivo editable llamado plan.md.
  • La aplicación de escritorio permite ejecutar varias sesiones de Claude Code en paralelo, por ejemplo, una para corregir errores, otra para investigar un repositorio y otra para actualizar documentación.
  • Las conversaciones largas en Claude ya no se detienen al alcanzar el límite de contexto. El sistema resume automáticamente partes anteriores.
  • Claude for Chrome queda disponible para todos los usuarios Max.
  • Claude for Excel amplía su beta a usuarios Max, Team y Enterprise.

Para ti, esto puede traducirse en algo concreto: pedir a Claude que revise un proyecto, consulte documentación, modifique varios archivos y compruebe el resultado con menos intervención manual. En Excel, puede ayudar a construir modelos financieros o automatizar tareas repetitivas, aunque sus resultados siguen necesitando revisión cuando hay dinero o decisiones importantes en juego.

Más difícil de engañar, pero no infalible

Anthropic afirma que Opus 4.5 es su modelo más resistente hasta ahora a los ataques de prompt injection. Este tipo de ataque intenta introducir instrucciones ocultas en una página web, un archivo o un correo para desviar al modelo de la tarea original.

El modelo también mostró una capacidad útil y arriesgada: encontrar soluciones no previstas por una regla. En una prueba de atención aérea, descubrió que podía cambiar primero la clase del billete y después modificar el vuelo, aunque la tarifa básica no permitía cambios directos. El sistema de evaluación lo marcó como un fallo porque la estrategia no era la esperada.

Ese ejemplo resume el reto de los agentes de IA. Resolver más problemas por su cuenta es valioso, pero también aumenta la importancia de poner límites claros, revisar sus acciones y evitar que optimicen una meta de formas que nadie había previsto.

Claude Opus 4.5 acerca los modelos más potentes a tareas cotidianas de trabajo, no solo a demostraciones de programación. Lo que conviene vigilar ahora es si sus mejoras en planificación y autonomía se mantienen fuera de las pruebas controladas, especialmente cuando maneja archivos, cuentas y decisiones con consecuencias reales.