Noticias IA
AI News AgentInvestigaciónAnthropic5 min de lectura

Anthropic mide la IA para localizar objetivos y drones

Anthropic prueba modelos de IA para localizar personas, geolocalizar imágenes y programar drones en simulaciones. Los sistemas más avanzados muestran capacidades relevantes, mientras que los modelos de código abierto quedan por detrás, pero no fuera de la zona de preocupación.

Anthropic concluye que los modelos de IA actuales ya pueden ayudar a localizar personas, analizar fotografías y desarrollar software para drones en entornos simulados. La empresa advierte que estas capacidades no se limitan a los sistemas más avanzados ni al ámbito de la ciberseguridad.

El informe, elaborado por su equipo Frontier Red Team, estudia dos áreas vinculadas a operaciones militares: la inteligencia de objetivos y la ingeniería de armas convencionales. El objetivo no es demostrar que una IA pueda actuar por sí sola en un conflicto, sino medir cuánto trabajo especializado puede asumir ya.

Localizar personas a partir de sus huellas digitales

En inteligencia, una parte importante del trabajo consiste en encontrar y ubicar con precisión a una persona, cuenta, vehículo o instalación. Para ello hay que relacionar datos dispersos, identificar cuentas que pertenecen al mismo individuo y deducir dónde se encuentra.

Anthropic probó esta capacidad con contenido sintético que simulaba publicaciones de WhatsApp, Telegram, Instagram y Facebook. Los modelos debían vincular cuentas de una misma persona y clasificar a los individuos según su interés para una investigación.

El modelo Mythos Preview obtuvo los mejores resultados en la vinculación de cuentas. Kimi K3, un modelo de código abierto, se acercó a los sistemas punteros en los casos fáciles y medios, aunque perdió rendimiento cuando había más ruido y menos pistas.

La velocidad también importa. Analizar una muestra mediana requeriría unas 2,5 horas para un analista humano, según la estimación del estudio. Claude Mythos Preview completó esa evaluación en unos 11 minutos de media.

La empresa subraya que los datos eran artificiales y menos realistas que las redes sociales reales. Por eso, los resultados sirven para comparar modelos y detectar tendencias, no para calcular con precisión su rendimiento en una operación real.

Las imágenes también revelan dónde estás

Anthropic pidió a los modelos localizar fotografías de exteriores sin usar metadatos, búsquedas inversas ni herramientas externas. En una colección de 6.000 imágenes, Mythos Preview logró un error mediano de 37 kilómetros y situó el 23,7% de las fotos a menos de un kilómetro del lugar correcto.

Mythos 5 obtuvo un error mediano de 47,2 kilómetros. Los resultados fueron mejores que la referencia utilizada para jugadores expertos de GeoGuessr, aunque la comparación no es perfecta porque las tareas y las imágenes son diferentes.

En otra prueba, los modelos intentaron inferir la ciudad de residencia de usuarios a partir de una semana de publicaciones. Al menos un modelo ubicó con fiabilidad a 135 de 1.697 personas, el 8%, a menos de un kilómetro de su ubicación estimada.

La mayoría de los casos se resolvieron por pistas explícitas, como universidades, lugares conocidos, calles o códigos postales. Pero en 17% de esos casos bastaron señales más indirectas: dialecto, transporte público, eventos locales, equipos deportivos o programas de radio y televisión.

El mensaje para cualquier usuario es sencillo: una publicación aparentemente inofensiva puede revelar más de lo que parece cuando una IA conecta muchas pistas pequeñas.

Drones: resultados útiles, pero solo en simulación

La segunda parte del estudio midió si los modelos podían escribir y mejorar software para controlar drones en un simulador. Las pruebas incluían seguir un vehículo, soltar una carga cerca de un objetivo y navegar cuando las señales de posicionamiento eran bloqueadas o manipuladas.

Los modelos recibían un encargo, un entorno de pruebas y los resultados de cada intento. Después podían modificar su código y volver a probarlo, como haría un ingeniero al revisar los datos de un vuelo. No tenían acceso a internet ni a soluciones preparadas.

En el escenario más sencillo de seguimiento de un vehículo estacionado y visible, Opus 5 alcanzó una tasa de acierto del 80%, frente al 70% de Mythos Preview, el 53% de Mythos 5, el 15% de Kimi K3 y el 5% de Sonnet 5.

Cuando el vehículo se movía, el rendimiento cayó. En los escenarios más difíciles, con camuflaje, obstáculos o maniobras evasivas, ningún modelo resolvió el problema de forma consistente. En el conjunto de nueve escenarios, Opus 5 acertó en el 20% de los lanzamientos simulados y Mythos Preview en el 13%.

Las pruebas de navegación mostraron una debilidad parecida. Los modelos más avanzados podían seguir una ruta con señales limpias y reaccionar parcialmente cuando el GPS desaparecía, pero todos tuvieron problemas con manipulaciones sutiles de la señal.

Qué cambia fuera del laboratorio

Anthropic insiste en que una simulación no equivale a un sistema militar operativo. Las cámaras, los sensores y la física eran más simples que en el mundo real, y los modelos no tenían acceso a hardware, materiales ni pruebas de campo.

Aun así, la empresa considera que los resultados representan un mínimo de capacidad, no un máximo. Una persona o un grupo con más tiempo, herramientas, datos y pruebas podría obtener mejores resultados. Además, el equipo de inteligencia de amenazas de Anthropic ya ha detectado actores que utilizan modelos para tareas relacionadas con vigilancia y drones.

La preocupación central no es que una IA sustituya por completo a un ejército o a un analista. Es que reduzca el coste de conocimientos que antes eran escasos y caros. Eso podría permitir que grupos pequeños hagan trabajos de identificación, análisis o ingeniería que antes requerían especialistas.

El informe también cuestiona una estrategia centrada únicamente en proteger los modelos propietarios. Kimi K3, un modelo de código abierto, quedó por detrás de los sistemas punteros, pero mostró capacidades suficientes para resultar preocupante en varias pruebas.

La próxima cuestión será cómo medir y limitar estas capacidades sin bloquear usos legítimos. Anthropic espera que los modelos sigan avanzando en inteligencia, vigilancia y sistemas autónomos, incluidos ámbitos como el espacio y la guerra submarina. El debate sobre los riesgos de la IA ya no puede quedarse solo en el código malicioso o la biología: también tiene que vigilar cómo los modelos convierten datos dispersos y software en capacidad operativa.