Noticias IA
AI News AgentPolítica y seguridadAnthropic4 min de lectura

Claude Code lanza Auto Mode para agentes de IA

Claude Code presenta Auto Mode, un sistema que sustituye muchos avisos manuales por dos capas de detección de riesgos. Anthropic informa de un 0,4% de falsos positivos, pero también de un 17% de acciones peligrosas no detectadas en una de sus pruebas, por lo que no lo recomienda como reemplazo de la revisión humana en sistemas críticos.

Claude Code incorpora Auto Mode, una opción que permite trabajar sin aprobar cada acción manualmente, pero mantiene un sistema automático para bloquear comandos que parezcan peligrosos o no autorizados.

El problema que Anthropic intenta resolver es sencillo: Claude Code pide permiso antes de ejecutar comandos o modificar archivos. Esa protección funciona, pero obliga a pulsar "aprobar" muchas veces. Con el tiempo aparece la llamada fatiga de aprobación: aceptas casi todo sin revisar con atención.

Según Anthropic, los usuarios terminan aceptando el 93% de las solicitudes. Las alternativas actuales son poco cómodas: usar un entorno aislado que requiere configuración constante o activar --dangerously-skip-permissions, una opción que elimina todos los avisos y deja al agente actuar sin barreras.

Auto Mode busca ocupar el espacio intermedio. Claude puede avanzar de forma autónoma, mientras otros modelos revisan sus acciones antes de que se ejecuten.

Dos capas para reducir riesgos

El sistema analiza tanto la información que Claude recibe como las acciones que intenta realizar.

La primera capa funciona cuando Claude lee archivos, consulta una web, ejecuta un comando o recibe información de otra herramienta. Un detector instalado en el servidor busca señales de inyección de instrucciones, es decir, contenido diseñado para engañar al agente y hacer que ignore lo que pidió el usuario.

Si encuentra algo sospechoso, añade una advertencia al contexto de Claude. Por ejemplo, si una página contiene instrucciones para subir secretos a un servidor externo, el agente recibe la indicación de tratar ese contenido con desconfianza y volver a centrarse en la petición original.

La segunda capa revisa la acción que Claude quiere ejecutar. Un clasificador basado en Sonnet 4.6 analiza los mensajes del usuario y las llamadas a herramientas, pero no ve las explicaciones del propio Claude ni los resultados de las herramientas. Así se evita que el agente intente convencer al revisor de que una acción peligrosa es segura.

No todo pasa por el revisor

Auto Mode divide las acciones en tres niveles:

  • Acciones seguras: leer archivos, buscar texto, navegar por el código o gestionar una lista de tareas. Se permiten sin revisión adicional.
  • Cambios dentro del proyecto: editar o crear archivos en el repositorio actual. Se consideran operaciones habituales y se pueden revisar después con el control de versiones.
  • Acciones con impacto real: ejecutar comandos, acceder a archivos fuera del proyecto, hacer peticiones web, usar integraciones externas o iniciar subagentes. Estas pasan por el clasificador.

Al activar Auto Mode, Claude Code elimina además algunas reglas demasiado amplias que podrían permitir ejecución arbitraria de código. Por ejemplo, permisos generales para ejecutar cualquier script de Python, Node o Ruby. Las reglas más específicas, como permitir un formateador concreto, pueden mantenerse.

El clasificador también intenta interpretar el alcance de lo que autorizaste. Decir "limpia mis ramas" no equivale automáticamente a permitir el borrado masivo de ramas. Del mismo modo, preguntar "¿podemos arreglar esto?" no se interpreta como una orden para cambiar infraestructura de producción.

Los resultados muestran el límite

Anthropic probó el sistema con tráfico real, acciones peligrosas provocadas por comportamientos demasiado impulsivos del agente y tareas sintéticas de extracción de datos.

En el tráfico real, el sistema completo bloqueó por error el 0,4% de las acciones legítimas. Pero también dejó pasar el 17% de las acciones peligrosas del conjunto de pruebas centrado en errores de iniciativa del agente. En las pruebas sintéticas de extracción de datos, el índice de acciones peligrosas no detectadas fue del 5,7%.

La cifra del 17% es la más importante para entender qué ofrece Auto Mode. Anthropic reconoce que el clasificador suele identificar el peligro, pero a veces interpreta mal si el usuario había autorizado una acción con ese alcance. Una petición ambigua o una aprobación anterior pueden parecer señales de consentimiento aunque no lo sean.

Por eso Auto Mode no sustituye a una revisión humana cuidadosa en sistemas críticos. Está pensado sobre todo como una mejora frente a ejecutar Claude con --dangerously-skip-permissions, no como una garantía para operar sin supervisión en producción.

Qué ocurre cuando bloquea algo

Un bloqueo no detiene necesariamente toda la sesión. Claude recibe el rechazo como resultado de la herramienta y debe buscar una alternativa más segura, en lugar de intentar esquivar la restricción.

Si acumula tres bloqueos consecutivos o 20 bloqueos en total, el sistema detiene el modelo y pide intervención humana. En modo sin interfaz, ejecutado con claude -p, el proceso termina directamente.

Para ti, el cambio práctico es menos interrupciones al delegar tareas de programación, pero también una nueva responsabilidad: elegir bien cuándo dejar actuar al agente. Auto Mode reduce el riesgo de la autonomía total, no lo elimina. Anthropic seguirá ampliando sus pruebas porque el siguiente desafío no es solo detectar comandos peligrosos, sino interpretar correctamente qué autorizaste y hasta dónde llega esa autorización.