Gemini Embedding 2 conecta texto, imagen, audio y vídeo
Google presenta Gemini Embedding 2, un modelo multimodal que relaciona texto, imágenes, vídeo, audio y PDF en un mismo espacio de significado. Está disponible en vista previa pública y puede usarse para búsquedas semánticas, RAG y análisis de datos.
Google abre en vista previa pública Gemini Embedding 2, un modelo capaz de convertir texto, imágenes, vídeo, audio y documentos en una representación común para que una aplicación pueda encontrar relaciones entre ellos. Está disponible a través de la Gemini API y Vertex AI.
Esto importa porque una búsqueda tradicional suele separar cada tipo de archivo. Un buscador puede localizar palabras en un documento, pero no siempre entiende que una imagen, una frase y un fragmento de audio hablan del mismo tema. Los embeddings, representaciones numéricas del significado de un contenido, permiten comparar esas piezas por su sentido y no solo por las palabras que contienen.
Un mismo modelo para varios formatos
Gemini Embedding 2 coloca diferentes tipos de contenido en un espacio compartido. Así, una aplicación puede buscar una imagen usando una descripción escrita, relacionar un vídeo con una pregunta o agrupar grabaciones de audio junto a documentos sobre el mismo asunto.
El modelo admite:
- Texto con un contexto de hasta 8.192 tokens, equivalentes a varios miles de palabras.
- Hasta 6 imágenes por solicitud, en formatos PNG y JPEG.
- Vídeos de hasta 120 segundos, en MP4 y MOV.
- Audio procesado directamente, sin tener que transcribirlo primero.
- Archivos PDF de hasta 6 páginas.
También entiende entradas combinadas. Puedes enviar una imagen junto con un texto en la misma solicitud para que capte la relación entre ambos, en lugar de analizar cada elemento por separado. Por ejemplo, una empresa podría buscar en su catálogo imágenes de un producto que además cumplan una descripción escrita concreta.
Menos piezas para construir una aplicación
Una de las consecuencias prácticas es que los equipos pueden evitar varios pasos y modelos especializados. En una aplicación de búsqueda multimodal, ya no sería necesario usar una herramienta para transcribir el audio, otra para analizar imágenes y otra para indexar el texto antes de intentar unir los resultados.
Google señala usos como:
- Búsqueda semántica, que encuentra contenido relacionado aunque no use las mismas palabras.
- RAG, una técnica que recupera información relevante antes de generar una respuesta.
- Análisis de opiniones y sentimientos en distintos formatos.
- Clasificación y agrupación de grandes colecciones de datos.
- Gestión de archivos que mezclan documentos, imágenes, audio y vídeo.
El modelo también permite elegir el tamaño de la representación final. Su configuración predeterminada usa 3.072 dimensiones, pero puede reducirse a 1.536 o 768. Esto permite intercambiar algo de calidad por menor almacenamiento y costes de búsqueda. Google recomienda 3.072, 1.536 y 768 dimensiones cuando se busca la mayor calidad posible.
Qué cambia para ti
Para el usuario final, el cambio puede aparecer en herramientas más capaces de buscar dentro de una biblioteca completa, no solo dentro del texto. Una consulta podría encontrar una página de un PDF, una escena de un vídeo y una grabación de voz porque todos expresan una idea similar.
Gemini Embedding 2 está en Public Preview, así que todavía se ofrece como una versión de prueba para desarrolladores. Google afirma que supera a modelos líderes en tareas de texto, imagen y vídeo, y que añade capacidades sólidas para audio, aunque el anuncio no publica aquí las cifras concretas de esas comparaciones.
Lo importante será comprobar cómo rinde en casos reales y cuánto cuesta usarlo a gran escala. Si mantiene un nivel consistente entre formatos, puede simplificar la construcción de buscadores y asistentes que hasta ahora necesitaban conectar varias herramientas distintas.