NVIDIA presenta Cosmos Policy para robots con IA
NVIDIA presenta Cosmos Policy, un modelo que combina percepción, control y planificación para que los robots ejecuten tareas a partir de imágenes. En las pruebas publicadas, alcanzó un 98,5 % de éxito medio en LIBERO y un 67,1 % en RoboCasa usando 50 demostraciones por tarea.

NVIDIA ha presentado Cosmos Policy, un modelo de inteligencia artificial que convierte imágenes de cámaras en movimientos para robots y, además, puede anticipar qué ocurrirá después de cada acción. La propuesta busca que los robots ejecuten tareas complejas con menos datos de entrenamiento.
Un modelo que observa, actúa y planifica
Una política robótica es el sistema que decide qué debe hacer una máquina a partir de lo que ve. Por ejemplo, recibe la imagen de una taza y calcula cómo mover un brazo para agarrarla sin tirar otros objetos.
Cosmos Policy parte de Cosmos Predict, un modelo entrenado para predecir cómo evolucionan las escenas en el tiempo. NVIDIA lo adapta para que no solo genere futuros fotogramas, sino también acciones del robot y una estimación de si esas acciones llevarán al objetivo.
La diferencia está en que el modelo trata las acciones, los estados físicos y las probabilidades de éxito como representaciones internas similares a los fotogramas de un vídeo. Así, aprovecha lo que ya ha aprendido sobre movimiento, gravedad y cambios en una escena.
En la práctica, un único modelo puede:
- Generar bloques de movimientos para coordinar la visión y el brazo robótico.
- Predecir cómo se verá la escena después de una acción.
- Valorar distintas opciones para elegir la que tenga más posibilidades de éxito.
Puede funcionar de forma directa, produciendo los movimientos necesarios, o como sistema de planificación. En este segundo modo, prueba mentalmente varias secuencias, predice sus consecuencias y escoge la más prometedora.
Resultados en tareas de manipulación
NVIDIA evaluó Cosmos Policy en LIBERO y RoboCasa, dos pruebas habituales para medir si un robot puede completar varias tareas, incluidas aquellas que requieren muchos pasos y una coordinación precisa.
En LIBERO obtuvo una tasa media de éxito del 98,5 %. La cifra supera a otros modelos comparados en los datos compartidos por NVIDIA, como OpenVLA-OFT, con un 97,1 %, y CogVLA, con un 97,4 %. En las tareas de ejecución prolongada, Cosmos Policy alcanzó un 97,6 %.
En RoboCasa, que simula tareas domésticas variadas, logró un 67,1 % de éxito medio usando 50 demostraciones por tarea. Ese resultado quedó por encima de modelos evaluados con más ejemplos, como π0, con un 62,5 % usando 300 demostraciones, y GR00T-N1.5, con un 64,1 % usando la misma cantidad.
La comparación no significa que el robot pueda resolver cualquier tarea doméstica. Son resultados obtenidos bajo las condiciones concretas de esos benchmarks y sirven, sobre todo, para medir generalización y eficiencia de datos.
La planificación mejora el resultado
Cuando Cosmos Policy actúa directamente, ya alcanza resultados competitivos en la mayoría de las tareas evaluadas. Al añadir planificación basada en el modelo, NVIDIA observó un 12,5 % más de tareas completadas en promedio en dos tareas exigentes de manipulación en el mundo real.
También se probó en tareas bimanuales con robots ALOHA. Según NVIDIA, el sistema pudo ejecutar secuencias largas usando únicamente observaciones visuales, aunque la publicación no presenta una tasa global de éxito para esas pruebas.
Qué cambia para la robótica
Muchos sistemas actuales parten de modelos de visión y lenguaje. Estos pueden entender una instrucción como «recoge la taza morada», pero no necesariamente saben calcular con precisión cómo mover un brazo, mantener el equilibrio o reaccionar si el objeto cambia de posición.
Cosmos Policy intenta cubrir ese salto usando un modelo que ya aprende cómo cambian las escenas con el tiempo. Para un desarrollador, esto puede traducirse en menos necesidad de entrenar desde cero un sistema distinto para percibir, actuar y planificar.
NVIDIA presenta el proyecto como una primera etapa y lo acompaña con recetas de Cosmos Cookbook para que los equipos puedan probarlo y adaptarlo. También señala que Cosmos Predict 2.5 ya está disponible como actualización de la familia de modelos.
Un hackathon para probar Cosmos
La compañía anunció además Cosmos Cookoff, un hackathon abierto para crear aplicaciones con los modelos Cosmos en robótica, vehículos autónomos y análisis de vídeo. La convocatoria se celebra del 29 de enero al 26 de febrero, con equipos de hasta cuatro personas.
Los premios incluyen 5.000 dólares en efectivo, una estación NVIDIA DGX Spark y una GPU GeForce RTX 5090, entre otros. El objetivo es llevar estos modelos de los benchmarks a prototipos que funcionen en escenarios físicos concretos.
Lo importante ahora es comprobar si las ventajas de Cosmos Policy se mantienen fuera de las pruebas controladas: con objetos nuevos, iluminación distinta y errores inesperados. Si lo consiguen, los modelos que predicen el mundo podrían convertirse en una pieza central para enseñar a los robots no solo a ver, sino también a anticipar las consecuencias de sus movimientos.