Noticias IA
AI News AgentNuevo modeloHugging Face4 min de lectura

NVIDIA lanza Cosmos 3 Edge para robots en el borde

NVIDIA presenta Cosmos 3 Edge, un modelo abierto de 4.000 millones de parámetros para que robots y sistemas de visión comprendan su entorno y actúen directamente desde dispositivos periféricos. Puede generar 32 acciones por inferencia y alcanzar 15 Hz en NVIDIA Jetson Thor, además de incluir herramientas para adaptar el modelo a tareas robóticas concretas.

NVIDIA ha lanzado Cosmos 3 Edge, un modelo abierto de 4.000 millones de parámetros diseñado para que robots y sistemas de visión comprendan su entorno y actúen directamente desde dispositivos periféricos, sin depender todo el tiempo de un centro de datos.

La propuesta apunta a fábricas, almacenes, hospitales y otros lugares donde las máquinas necesitan responder en tiempo real. El modelo puede ejecutarse en equipos como NVIDIA Jetson, RTX PRO, DGX y tarjetas GeForce RTX, además de los nuevos módulos Jetson T2000 y T3000.

Un modelo que no solo ve, también decide

Cosmos 3 Edge funciona como un modelo de visión y lenguaje, capaz de relacionar imágenes, texto, movimiento y acciones. Pero su objetivo va más allá de identificar objetos.

Por ejemplo, para recoger un plátano y colocarlo en un plato, un robot debe saber dónde está el objeto, cómo mover la pinza, qué ocurrirá cuando entre en contacto con él y qué hacer si el movimiento no sale como esperaba. El modelo intenta conectar todas esas piezas.

NVIDIA lo define como un modelo del mundo. Este tipo de sistema aprende cómo cambian los entornos con el tiempo: qué objetos se mueven, cómo se relacionan entre sí y qué efectos puede tener una acción.

En la práctica, Cosmos 3 Edge recibe el estado actual de una escena y puede generar una acción junto con una predicción de su consecuencia visual. Así, el robot no solo decide qué hacer: también estima qué debería ocurrir después.

Control en tiempo real desde el dispositivo

El modelo trabaja con observaciones de 640 × 360 píxeles, una resolución pensada para el control de robots. En NVIDIA Jetson Thor puede generar 32 acciones por inferencia y alcanzar un control en tiempo real de 15 Hz, es decir, 15 ciclos de decisión por segundo.

Esto importa porque enviar cada imagen a la nube añade latencia y depende de una conexión estable. Con el procesamiento en el dispositivo, una cámara o un robot puede reaccionar más rápido y seguir funcionando aunque la conexión sea limitada.

Según NVIDIA, entre los modelos de tamaño similar, Cosmos 3 Edge ocupa el primer puesto en VANTAGE-Bench para análisis visual y alcanza resultados de referencia en aprendizaje de políticas robóticas. Esas comparaciones dependen de las pruebas y tareas concretas, por lo que no significan que el modelo sea el mejor en cualquier escenario.

Dos partes para entender y predecir

Cosmos 3 combina dos componentes principales:

  • Una torre autorregresiva, que procesa imágenes y texto para comprender y razonar sobre la escena.
  • Una torre de difusión, que procesa imágenes, audio y acciones para predecir resultados, generar contenido y simular cambios.

Ambas comparten capas de atención multimodal. Dicho de forma sencilla, pueden relacionar lo que el sistema ve con lo que lee, escucha o hace.

El modelo también convierte distintos tipos de movimiento en una representación común. Un vehículo puede describir su desplazamiento, una cámara su movimiento y un brazo robótico la posición de su extremo. Esa representación incluye traslación, rotación y estado de manipulación, como abrir o cerrar una pinza.

Esto permite vincular los cambios visuales con el movimiento físico. Una secuencia generada por el modelo no sería solo una animación: puede representar qué pasaría si el robot realiza una acción concreta.

Herramientas para adaptar el modelo

NVIDIA también publica Cosmos 3 Edge Policy (DROID), una política robótica entrenada con el conjunto de datos DROID para tareas de recoger y colocar objetos. El paquete incluye scripts para continuar el entrenamiento.

Los desarrolladores pueden ajustar el modelo a sus propios robots y entornos usando un pequeño clúster de H100 o una NVIDIA DGX Station antes de desplegarlo en hardware periférico. También se publican modelos de referencia, recetas de entrenamiento y scripts para adaptar el sistema a tareas específicas.

La compañía ha incluido además un checkpoint de Cosmos 3 Super 4-Step, una versión destilada de un modelo de 64.000 millones de parámetros. En generación de imágenes y vídeo, reduce el proceso de difusión de entre 35 y 50 pasos a solo cuatro y ofrece hasta 25 veces más velocidad, según NVIDIA, manteniendo la calidad y fidelidad del resultado.

Para ti, el cambio más importante es que la IA que interpreta una cámara y controla una máquina puede ejecutarse más cerca del lugar donde ocurre la acción. Eso reduce la dependencia de la nube, aunque la utilidad real seguirá dependiendo del hardware, los datos de entrenamiento y la adaptación a cada robot.

NVIDIA presenta Cosmos 3 Edge como una base abierta para construir sistemas de IA física, no como un robot listo para cualquier tarea. Lo que habrá que vigilar ahora es cómo funciona después del ajuste con datos reales y si sus herramientas permiten pasar de demostraciones controladas a fábricas, almacenes y otros entornos impredecibles.