NVIDIA Nemotron 3 Embed lidera el ranking RTEB
NVIDIA presenta Nemotron 3 Embed, una familia de modelos abiertos para búsqueda semántica, RAG y memoria de agentes. Su versión de 8B ocupa el primer puesto de RTEB con 78,5%, mientras que las variantes de 1B priorizan menor coste, latencia y uso de memoria.

NVIDIA ha lanzado Nemotron 3 Embed, una familia de modelos de IA que convierte textos, documentos y código en representaciones numéricas para que los sistemas puedan encontrar información relevante. El modelo principal, Nemotron-3-Embed-8B-BF16, ocupa el primer puesto del ranking RTEB, según las pruebas publicadas por NVIDIA.
Estas representaciones, llamadas embeddings, son una pieza clave de la búsqueda semántica y de los sistemas RAG. En vez de buscar solo palabras exactas, permiten encontrar documentos relacionados con el significado de una consulta. Por ejemplo, una pregunta sobre “cómo recuperar una cuenta” puede localizar una guía titulada “restablecimiento de credenciales”, aunque no comparta las mismas palabras.
Tres modelos para distintos niveles de coste
La familia incluye tres modelos abiertos con objetivos diferentes:
Nemotron-3-Embed-8B-BF16: el modelo de mayor calidad, pensado para búsquedas donde la precisión es prioritaria.Nemotron-3-Embed-1B-BF16: una opción más pequeña para sistemas donde importan la latencia y el coste.Nemotron-3-Embed-1B-NVFP4: una variante optimizada para hardware NVIDIA Blackwell y grandes volúmenes de consultas.
El modelo de 8.000 millones de parámetros obtuvo 78,5% en RTEB y 75,5% en MMTEB Retrieval. RTEB es un conjunto de pruebas que compara la capacidad de distintos modelos para recuperar información relevante en varias tareas y lenguas.
La versión de 1.14 mil millones de parámetros alcanzó 72,4% en RTEB. NVIDIA afirma que esto reduce en un 27% la tasa de error frente a su modelo anterior de tamaño similar, llama-nemotron-embed-vl-1b-v2. En MMTEB Retrieval logró 71%, con una reducción de error del 28% respecto a ese precedente.
Por qué importa para los agentes de IA
Un buscador más preciso no solo mejora los resultados que ve una persona. También puede reducir el trabajo que tiene que hacer un agente de IA. Si encuentra antes la evidencia correcta, necesita menos búsquedas repetidas, menos pasos de razonamiento y menos texto que procesar.
En las pruebas de NVIDIA, un agente basado en Nemotron 3 Ultra utilizó los nuevos embeddings en tareas de ViDoRe V3, BRIGHT y BrowseComp-Plus. La compañía asegura que el modelo de 8B logró la mayor precisión media y el menor coste estimado de tokens por consulta en ese conjunto de evaluaciones. Ese coste se calculó usando el precio de GPT-5.5, por lo que no representa necesariamente el gasto de cualquier sistema real.
Los modelos también ofrecen una ventana de contexto de 32.000 tokens, suficiente para trabajar con documentos largos, repositorios de código y el historial de conversaciones de un agente. Incluyen soporte multilingüe y pueden adaptarse a sectores como finanzas, salud, educación y asuntos legales.
Menor tamaño, más velocidad
La variante Nemotron-3-Embed-1B-NVFP4 reduce el tamaño de los cálculos mediante NVFP4, un formato de 4 bits optimizado para tarjetas NVIDIA Blackwell. NVIDIA afirma que puede alcanzar hasta el doble de rendimiento que la versión BF16 en ciertos escenarios de alta demanda y conservar más del 99% de su precisión de recuperación, con un menor uso de memoria.
La compañía también ofrece un microservicio NVIDIA NIM para desplegar el modelo en producción, además de compatibilidad con Hugging Face y vLLM. Los pesos, los datos y las recetas de entrenamiento están disponibles para que las empresas puedan inspeccionar, ajustar y ejecutar los modelos en su propia infraestructura.
El ajuste con datos propios puede marcar una diferencia importante. En una evaluación sobre documentación de NVIDIA, adaptar el modelo de 1B elevó el indicador NDCG@10 de 56,7% a 63,3% y Recall@5 de 56,1% a 62,8%.
Para ti, el cambio más relevante no está en el ranking por sí solo. Está en que la búsqueda que alimenta a los asistentes, los buscadores internos y la memoria de los agentes puede hacerse más precisa sin obligar a todas las empresas a usar un modelo grande y caro. El siguiente punto a vigilar será cómo se comportan estos resultados en datos empresariales reales, donde la calidad de los documentos, el idioma y el ajuste al dominio suelen importar tanto como el modelo.