Noticias IA
AI News AgentNuevo modeloAnthropic2 min de lectura

Claude Opus 4.1 mejora la programación con IA

Anthropic lanza Claude Opus 4.1 con mejoras en programación, investigación y análisis de datos. El modelo alcanza un 74,5 % en SWE-bench Verified, mantiene el precio de Opus 4 y ya está disponible para usuarios de pago, desarrolladores y proveedores de nube.

Anthropic ha lanzado Claude Opus 4.1, una actualización de su modelo más avanzado para programar, investigar y resolver tareas complejas. Ya está disponible para usuarios de pago de Claude, Claude Code y clientes de su API, Amazon Bedrock y Google Cloud Vertex AI.

La mejora principal aparece en programación real: Claude Opus 4.1 alcanza un 74,5 % en SWE-bench Verified, una prueba que mide si un modelo puede resolver problemas de código tomados de proyectos reales. Anthropic afirma que el modelo es especialmente eficaz al trabajar con varios archivos y al hacer cambios precisos sin modificar partes que no necesita tocar.

El precio se mantiene igual que el de Claude Opus 4. Para usarlo desde la API, los desarrolladores deben seleccionar el modelo claude-opus-4-1-20250805.

Menos cambios innecesarios al programar

La diferencia no está solo en que Claude escriba código. También importa cómo modifica un proyecto existente.

GitHub señala que Opus 4.1 mejora frente a Opus 4 en la mayoría de las capacidades y destaca sus resultados al reorganizar código repartido en varios archivos. Rakuten Group, por su parte, asegura que el modelo identifica correcciones concretas dentro de bases de código grandes sin introducir ajustes innecesarios ni nuevos errores.

En la práctica, esto puede servir para depurar una aplicación sin que la IA reescriba funciones que ya funcionan. Es una ventaja importante cuando el código tiene miles de archivos y un cambio pequeño puede provocar problemas en otra parte del sistema.

Windsurf, una plataforma de herramientas para desarrolladores, informa de una mejora de una desviación estándar en su prueba para programadores júnior. Según la empresa, el salto es aproximadamente comparable al que hubo entre Sonnet 3.7 y Sonnet 4 en ese mismo entorno.

También mejora la investigación

Anthropic afirma que Opus 4.1 avanza en investigación detallada y análisis de datos, sobre todo al seguir información específica y realizar búsquedas con varios pasos. Ese tipo de trabajo se conoce como tarea agéntica: la IA no responde de una vez, sino que decide qué buscar, usa herramientas y conecta resultados antes de entregar una respuesta.

Puede ser útil, por ejemplo, para comparar documentos extensos, revisar datos de una empresa o investigar un problema técnico sin perder detalles importantes durante el proceso.

Los resultados publicados tienen algunos matices. El 74,5 % de SWE-bench Verified se obtuvo sin activar el razonamiento extendido, mientras que otras pruebas citadas por Anthropic, como GPQA Diamond, AIME y TAU-bench, usaron hasta 64.000 tokens de razonamiento. Además, Anthropic y OpenAI no reportan exactamente el mismo número de problemas en SWE-bench: Claude se evalúa sobre los 500 ejercicios, mientras que los resultados de OpenAI usan un subconjunto de 477.

Para la mayoría de usuarios, el cambio significa una versión más precisa de Claude Opus 4, no un producto completamente distinto. Anthropic recomienda actualizar desde Opus 4 y adelanta que prepara mejoras de mayor tamaño para las próximas semanas. Conviene comprobar si esas mejoras se mantienen en proyectos cotidianos, no solo en las pruebas de referencia.