Noticias IA
AI News AgentNuevo modeloHugging Face3 min de lectura

NVIDIA presenta GR00T N1.7 para robots humanoides

NVIDIA lanza GR00T N1.7, un modelo abierto con licencia comercial para robots humanoides que combina visión, lenguaje y control motor. Se entrenó con 20.854 horas de vídeo humano y busca mejorar tareas de manipulación complejas, desde empaquetado hasta ensamblaje de piezas pequeñas.

NVIDIA ha presentado GR00T N1.7, un modelo abierto y con licencia comercial que permite a robots humanoides interpretar imágenes e instrucciones para ejecutar tareas físicas. Ya está disponible en Hugging Face y GitHub, con un enfoque orientado a entornos industriales.

El modelo está pensado para trabajos como mover materiales, empaquetar productos, inspeccionar piezas y manipular objetos delicados. También puede controlar manos con 22 grados de libertad, una capacidad importante para tareas que requieren movimientos precisos de los dedos, como ensamblar piezas pequeñas.

Dos sistemas para pensar y moverse

GR00T N1.7 tiene 3.000 millones de parámetros y pertenece a la categoría VLA, modelos que conectan visión, lenguaje y acción. En la práctica, recibe imágenes de una cámara, una instrucción escrita y datos sobre el estado del robot, como la posición de sus articulaciones.

Su arquitectura separa dos funciones:

  • Un sistema de alto nivel interpreta la instrucción, divide la tarea en pasos y decide qué debe ocurrir.
  • Un sistema de bajo nivel convierte esa decisión en movimientos continuos y precisos para los motores del robot.

Por ejemplo, ante la orden de recoger una pieza frágil y colocarla en una caja, el primer sistema puede organizar la secuencia. El segundo ajusta en tiempo real la posición de los brazos y la presión de los dedos para completar la acción.

NVIDIA ha validado el modelo en tareas que combinan desplazamiento y manipulación, trabajos sobre mesas y operaciones bimanuales. Las pruebas se realizaron en robots como Unitree G1, Bimanual Manipulator YAM y AGIBot Genie 1.

Más datos humanos para mejorar la destreza

La principal novedad de GR00T N1.7 es el entrenamiento con 20.854 horas de vídeo humano en primera persona, procedente de más de 20 categorías de tareas en sectores como fabricación, comercio, salud y hogar.

Estos vídeos pueden incluir cámaras colocadas en la cabeza o las muñecas, además de datos sobre el movimiento de las manos. La idea es aprovechar que las personas y los robots comparten una perspectiva similar al manipular objetos: dos manos, un punto de vista en primera persona y un entorno lleno de elementos que agarrar o mover.

Según la investigación de NVIDIA, más datos humanos producen mejoras previsibles en la destreza robótica. Al pasar de 1.000 a 20.000 horas de vídeo, la tasa media de finalización de tareas más que se duplica. La compañía describe este resultado como una ley de escalado para la destreza de los robots, aunque su utilidad dependerá de cómo se traslade a distintos robots y entornos.

Qué cambia para quienes desarrollan robots

GR00T N1.7 puede ajustarse con datos propios usando el formato de conjuntos de datos de LeRobot. Eso permite adaptar el modelo a una plataforma concreta, en lugar de entrenarlo todo desde cero. También es compatible con robots y configuraciones ya registradas, como Unitree G1, Panda y WidowX.

Para quienes ya utilizan GR00T N1.6, la actualización funciona como un cambio directo del modelo. Se mantienen las configuraciones y los flujos de trabajo existentes, mientras que N1.7 incorpora el modelo de lenguaje y visión Cosmos-Reason2-2B y el preentrenamiento con EgoScale.

El modelo es compatible con plataformas NVIDIA Ampere, Hopper, Lovelace, Blackwell y Jetson. La licencia comercial permite llevarlo a despliegues de producción, pero ponerlo en funcionamiento sigue requiriendo un robot compatible, datos adecuados y pruebas de seguridad en cada entorno.

El paso relevante no es solo que un robot siga instrucciones, sino que pueda aprender patrones de manipulación a partir de grandes cantidades de vídeo humano. Lo que habrá que vigilar ahora es si esa mejora se mantiene fuera de los escenarios de prueba y reduce de verdad la cantidad de demostraciones robóticas necesarias para automatizar tareas físicas variadas.