WildDet3D lleva la IA 3D a cualquier objeto
WildDet3D detecta objetos en 3D desde una sola imagen y acepta consultas de texto, puntos o cajas 2D. El modelo abierto incluye datos sobre más de 13.000 categorías y mejora los resultados en pruebas con objetos nuevos, aunque todavía requiere procesamiento en servidor para funcionar en tiempo real.

WildDet3D puede detectar objetos en 3D a partir de una sola imagen, aunque no estén en una lista fija de categorías. El modelo estima dónde está cada objeto, qué tamaño tiene y cómo está orientado, y permite buscarlo con texto, un punto o una caja 2D.
La tecnología, presentada por el Allen Institute for AI, está pensada para escenarios en los que una cámara debe entender el espacio físico: un robot que recoge paquetes, unas gafas inteligentes que identifican lo que hay alrededor o una aplicación de realidad aumentada que coloca indicaciones sobre una calle.
De "qué es" a "dónde está"
La mayoría de los sistemas de visión pueden reconocer que en una foto hay una silla, un coche o una persona. El problema es saber a qué distancia está, cuánto ocupa en el mundo real y hacia dónde apunta usando solo una imagen.
WildDet3D aborda ese problema con detección 3D monocular, es decir, reconstruye la posición y el volumen de los objetos a partir de una única imagen RGB. Puedes escribir "extintor" para localizar todos los extintores de la escena, tocar un objeto en la imagen o proporcionar una caja 2D procedente de otro sistema.
El modelo también acepta imágenes muy distintas entre sí, como una foto recortada tomada con un móvil, una toma de gran angular o la señal de una cámara robótica, sin necesidad de ajustarlo de nuevo para cada cámara.
Cuando hay información adicional de profundidad, como la que proporcionan un sensor LiDAR, una cámara RGB-D o un sistema estéreo, WildDet3D puede incorporarla para mejorar sus estimaciones.
Un modelo, varias formas de pedirle algo
La flexibilidad está en la forma de indicarle qué debe localizar:
- Texto: escribes una categoría, como "silla", y el sistema encuentra sus instancias.
- Punto: señalas un objeto concreto y devuelve su caja 3D.
- Caja 2D: recibe una detección convencional y calcula su posición y tamaño en tres dimensiones.
También puede combinarse con un modelo de visión y lenguaje como Molmo 2. Ese modelo interpreta la petición del usuario y pasa la región relevante a WildDet3D para obtener su localización 3D.
Esta conexión permite, por ejemplo, convertir un detector 2D o un sistema de seguimiento en una herramienta de seguimiento 3D. Si una caja 2D identifica un objeto en cada fotograma de un vídeo, WildDet3D puede elevar esas detecciones a coordenadas tridimensionales sin haber sido entrenado específicamente para seguimiento.
Hay una limitación importante: el modelo completo todavía necesita procesamiento en servidores o más optimización para funcionar en tiempo real directamente en un dispositivo.
Más de un millón de imágenes para objetos poco habituales
El proyecto incluye WildDet3D-Data, un conjunto de datos con más de un millón de imágenes y 3,7 millones de anotaciones 3D verificadas. El material cubre más de 13.000 categorías de objetos e incluye más de 100.000 imágenes revisadas por personas.
Para construirlo, el equipo generó posibles cajas 3D a partir de grandes conjuntos de imágenes 2D, como COCO, LVIS, Objects365 y V3Det. Después filtró y refinó esas propuestas con varios métodos de estimación 3D, modelos de visión y lenguaje y selección humana.
El objetivo es evitar uno de los problemas habituales de la visión 3D: entrenar con pocas categorías y que el modelo funcione bien solo en escenarios concretos, como interiores o conducción. Según las evaluaciones del equipo, el nuevo conjunto ayuda a generalizar a más de 700 categorías en situaciones reales.
Resultados en las pruebas
En Omni3D, un conjunto de referencia que reúne seis bases de datos interiores y exteriores y 50 categorías, WildDet3D obtiene 34,2 AP usando consultas de texto. AP, o precisión media, mide cuánto coinciden las cajas 3D predichas con las posiciones y tamaños reales. El resultado supera en 5,8 puntos al anterior mejor registro citado por el equipo.
Con cajas 2D de referencia, alcanza 36,4 AP. Si se añade profundidad dispersa durante la prueba, las cifras suben a 41,6 AP con texto y 45,8 AP con cajas.
El modelo también se probó sin entrenamiento específico adicional en otros conjuntos de datos:
- 40,3 ODS en Argoverse 2, frente a 23,8 del mejor resultado anterior.
- 48,9 ODS en ScanNet, una mejora de 17,4 puntos.
- En categorías nuevas de Argoverse 2, 38,6 ODS frente a 14,8.
- En categorías nuevas de ScanNet, 45,8 frente a 15,7.
ODS combina varios aspectos de la detección, como precisión, posición, escala y orientación. Los resultados son especialmente relevantes porque miden qué ocurre cuando el objeto no pertenece a las categorías habituales del entrenamiento.
En la prueba propia WildDet3D-Bench, que cubre más de 700 categorías, el modelo llega a 22,6 AP con consultas de texto después de entrenarse con los datos adicionales. En objetos poco frecuentes alcanza 47,4 AP, frente a 2,4 del sistema de comparación citado por el equipo.
Qué cambia en la práctica
Para ti, esto significa que una cámara puede pasar de reconocer etiquetas a construir una representación más útil del espacio. Una aplicación podría identificar una mesa concreta y calcular sus dimensiones; un robot podría estimar dónde termina una caja antes de agarrarla; y unas gafas podrían seguir la posición de un objeto mientras te mueves.
El proyecto incluye el modelo, los datos, los materiales de evaluación, una demostración interactiva y una aplicación para iOS. Esta última usa la cámara y el sensor LiDAR de dispositivos compatibles para mostrar cajas 3D sobre la imagen en realidad aumentada.
WildDet3D no convierte cualquier cámara en un sistema perfecto de percepción espacial. La precisión depende de la imagen, de la profundidad disponible y del procesamiento necesario. Pero su dirección es clara: la detección 3D empieza a salir de los escenarios cerrados y de las listas pequeñas de objetos. Lo que habrá que vigilar ahora es si estos modelos pueden mantener esa amplitud con suficiente velocidad y fiabilidad para funcionar dentro de robots, móviles y gafas, no solo en demostraciones o servidores.