NVIDIA lanza Nemotron ColEmbed V2 para búsqueda IA
NVIDIA presenta Nemotron ColEmbed V2, una familia de modelos multimodales que busca información en textos, tablas, gráficos e imágenes. Su versión de 8B lidera el benchmark ViDoRe V3, aunque requiere almacenar muchas más representaciones que los modelos de vector único.

NVIDIA presenta Nemotron ColEmbed V2, una familia de modelos que busca información en documentos donde el texto es solo una parte del contenido. También puede encontrar respuestas en tablas, gráficos, imágenes, páginas escaneadas e infografías.
La familia está disponible en tres tamaños: 3B, 4B y 8B. Su objetivo es mejorar la recuperación multimodal, es decir, la capacidad de localizar contenido relevante aunque la pregunta esté escrita como texto y la respuesta se encuentre dentro de una imagen o una página visualmente compleja.
El modelo que encabeza las pruebas
El nemotron-colembed-vl-8b-v2 ocupa el primer puesto en ViDoRe V3, un benchmark diseñado para medir cómo los sistemas recuperan páginas útiles dentro de documentos empresariales. Obtuvo una puntuación NDCG@10 de 63,42, una métrica que evalúa si los resultados más relevantes aparecen entre los diez primeros.
Los otros modelos de la familia también aparecen entre los primeros puestos de sus respectivas categorías de tamaño:
nemotron-colembed-vl-4b-v2: tercer puesto, con 61,54 puntos.llama-nemotron-colembed-vl-3b-v2: sexto puesto, con 59,79 puntos.
Según NVIDIA, los tres modelos alcanzan el estado del arte en las versiones V1, V2 y V3 de ViDoRe. La comparación corresponde a los resultados disponibles el 3 de febrero de 2026.
Qué cambia frente a una búsqueda tradicional
Muchos sistemas convierten una consulta completa y cada documento en un único vector, una representación numérica que permite comparar significados rápidamente. Es una opción eficiente y ocupa poco almacenamiento, pero puede perder detalles importantes.
Nemotron ColEmbed V2 utiliza otro enfoque, conocido como interacción tardía. En lugar de guardar una sola representación por documento, genera varios vectores para sus distintos elementos. Después compara cada parte de la consulta con todas las partes del documento y combina las coincidencias más fuertes.
Esto permite distinguir, por ejemplo, entre una página que menciona una cifra y otra que contiene la tabla exacta que responde a la pregunta. También ayuda a relacionar una consulta textual con un gráfico o una imagen, aunque no exista una coincidencia literal de palabras.
El coste es claro: hay que almacenar muchos más vectores para todo el corpus de documentos. Por eso estos modelos están pensados para casos donde la precisión importa más que el consumo mínimo de recursos.
Diseñado para sistemas RAG más visuales
La tecnología puede utilizarse en sistemas RAG, aplicaciones que primero recuperan información relevante y después la entregan a un modelo generativo para elaborar una respuesta. En la práctica, podrías preguntar por los ingresos de una empresa y obtener como fuente la página de un informe que contiene un gráfico, una tabla o ambos.
También puede servir para:
- Motores de búsqueda multimedia.
- Búsqueda entre documentos y otros formatos visuales.
- Asistentes que entienden páginas completas, gráficos e infografías.
- Sistemas empresariales que consultan informes escaneados o con diseños complejos.
NVIDIA diferencia esta familia de su modelo Llama-Nemotron-Embed-VL-1B, presentado anteriormente. El modelo de 1B prioriza el bajo almacenamiento y un alto volumen de consultas, mientras que ColEmbed V2 está orientado a la máxima precisión y conserva representaciones múltiples de cada documento.
Qué hay dentro de los modelos
Los modelos usan atención bidireccional, que permite analizar toda la secuencia de entrada en lugar de procesarla únicamente en una dirección. Además, aplican un mecanismo basado en ColBERT que calcula la similitud entre los elementos de la consulta y los del documento.
El modelo de 3B parte de una combinación de SigLIP 2 y Llama 3.2. Las versiones de 4B y 8B se basan en Qwen3-VL-4B-Instruct y Qwen3-VL-8B-Instruct, respectivamente. NVIDIA también incorporó datos sintéticos multilingües, ejemplos difíciles de descartar y una técnica de combinación de modelos para mejorar la estabilidad sin añadir latencia durante la inferencia.
Para ti, la diferencia no estará en una interfaz nueva, sino en la calidad de las respuestas que dependen de documentos complicados. El siguiente punto a vigilar es si esa mejora en las pruebas justifica el mayor coste de almacenamiento y procesamiento cuando estos modelos pasen de los experimentos a sistemas empresariales reales.