NVIDIA presenta modelos de IA física para cirugía
NVIDIA y 35 organizaciones lanzan Open-H-Embodiment, un conjunto abierto con 778 horas de datos para entrenar robots sanitarios. El proyecto incluye dos modelos para ejecutar suturas y generar simulaciones quirúrgicas, aunque todavía se encuentra en fase experimental y no sustituye la validación clínica.

NVIDIA y una comunidad de 35 organizaciones han presentado Open-H-Embodiment, un conjunto de datos abierto para entrenar robots capaces de actuar en entornos sanitarios, no solo de interpretar imágenes o detectar enfermedades.
El proyecto reúne 778 horas de datos con información sincronizada de visión, fuerza y movimiento. Incluye simulaciones, ejercicios de laboratorio como suturas y procedimientos clínicos reales, además de datos de robots comerciales y plataformas de investigación.
La iniciativa se centra sobre todo en robótica quirúrgica, aunque también incorpora tareas de ecografía y colonoscopia. Sus datos se publican con licencia CC-BY-4.0, lo que permite a otros equipos utilizarlos y adaptarlos respetando sus condiciones.
De analizar imágenes a manipular instrumentos
Hasta ahora, buena parte de la IA médica se ha entrenado para reconocer señales: localizar una lesión, clasificar una imagen o segmentar un órgano. Eso sirve para apoyar decisiones, pero no basta para que un robot realice una tarea física.
Un sistema quirúrgico debe coordinar cámaras, instrumentos, fuerzas y movimientos en tiempo real. También tiene que lidiar con tejidos blandos, reflejos, sangre, humo y diferencias entre robots. Por eso, los conjuntos de datos tradicionales, basados únicamente en imágenes, dejan fuera una parte esencial del problema.
Open-H-Embodiment intenta cubrir ese hueco con datos de nueve tipos de robots y 32 conjuntos de datos. La colaboración incluye universidades, hospitales, fabricantes de robots y empresas de software de distintos países.
Dos modelos para entrenar y simular robots
El conjunto de datos llega acompañado de dos modelos de código abierto.
El primero es GR00T-H, un modelo de visión, lenguaje y acción derivado de la familia Isaac GR00T. Se entrenó con aproximadamente 600 horas de datos de Open-H-Embodiment y está diseñado para aprender tareas de robótica quirúrgica a partir de demostraciones.
En la práctica, el modelo recibe información visual y una instrucción, y genera acciones para controlar un robot. Para funcionar con plataformas diferentes, utiliza varios mecanismos:
- Un adaptador específico para las características de movimiento de cada robot.
- Acciones relativas al extremo del instrumento, en lugar de órdenes ligadas a una máquina concreta.
- Información sobre los instrumentos y los controles dentro de las instrucciones de la tarea.
- Una configuración que prescinde de los datos de posición interna del robot durante la ejecución.
Un prototipo de GR00T-H completó una sutura de principio a fin en el benchmark SutureBot, una prueba de laboratorio para evaluar destreza quirúrgica. El resultado demuestra una capacidad experimental, no una autorización para operar de forma autónoma en pacientes.
El segundo modelo, Cosmos-H-Surgical-Simulator, genera vídeo quirúrgico a partir de las acciones y movimientos de un robot. Su objetivo es servir como un simulador aprendido: puede predecir cómo se deforman los tejidos y cómo interactúan los instrumentos sin tener que ejecutar cada prueba en el mundo real.
Según NVIDIA, generar 600 recorridos tardó unos 40 minutos en simulación, frente a dos días mediante métodos físicos de laboratorio. El modelo se ajustó con unos 10.000 GPU-horas en 64 tarjetas A100 y utiliza un espacio común de 44 dimensiones para representar las acciones.
Qué cambia para la robótica médica
Para investigadores y fabricantes, la disponibilidad de datos compartidos puede reducir el tiempo necesario para entrenar y comparar sistemas. También facilita probar un modelo en distintos robots, algo importante porque cada plataforma tiene brazos, controles y capacidades diferentes.
Para los pacientes, el efecto no será inmediato. Estos modelos todavía necesitan validación clínica, controles de seguridad y supervisión humana antes de participar en procedimientos reales. La utilidad más cercana está en la investigación, la formación y la automatización de tareas acotadas.
El siguiente paso del proyecto será añadir datos que expliquen por qué el robot toma una decisión, qué intenta hacer, cuál fue el resultado y cómo respondió ante un fallo. La meta es pasar de robots que imitan movimientos a sistemas capaces de planificar, adaptarse y explicar sus acciones durante procedimientos largos.
La cuestión clave será comprobar si los modelos abiertos mantienen su rendimiento fuera de los laboratorios y con distintos equipos. En cirugía, aprender a mover un instrumento es solo el principio: también hay que saber cuándo detenerse.