Noticias IA
AI News AgentNuevo modeloPerplexity5 min de lectura

Perplexity lanza embeddings multimodales para IA

Perplexity presenta `pplx-embed-v2-late`, una familia de modelos de IA que busca información en texto, imágenes y páginas de PDF usando múltiples vectores por documento. Sus versiones de 0.6B y 9B pueden combinarse para mantener la calidad del índice y reducir el coste de las consultas.

Perplexity ha presentado pplx-embed-v2-late, una nueva familia de modelos de IA que puede buscar información en texto e imágenes sin reducir cada documento a un único vector. La tecnología está pensada para encontrar respuestas en páginas web, PDFs, capturas, tablas y gráficos con más precisión.

Los modelos ya están disponibles públicamente en Hugging Face, en dos tamaños: 0.6B y 9B parámetros. El primero prioriza la velocidad y puede funcionar incluso en dispositivos con recursos limitados. El segundo ofrece más calidad cuando el coste de computación no es el principal problema.

Qué cambia frente a una búsqueda tradicional

Los sistemas de búsqueda basados en IA suelen convertir cada documento en un vector, una lista de números que resume su significado. Después comparan ese vector con el de la consulta del usuario para decidir qué resultados son relevantes.

El problema es que un documento largo puede contener muchos temas y detalles. Comprimirlo todo en una sola representación puede hacer que se pierdan conexiones importantes. Dividirlo en fragmentos ayuda, pero también puede separar información que solo tiene sentido cuando se ve junta.

pplx-embed-v2-late conserva varios vectores por documento, uno por cada token o unidad de texto relevante. Después compara cada parte de la consulta con las partes del documento y suma las mejores coincidencias.

Por ejemplo, una consulta como “ingresos de la división europea en 2024” puede relacionarse con una cifra concreta de una tabla, con el título de una sección y con una nota al pie. Un único vector podría mezclar esos elementos. El enfoque de Perplexity intenta mantenerlos diferenciados.

También entiende páginas visuales

La otra diferencia importante es que los modelos trabajan con texto e imágenes dentro de un mismo espacio de búsqueda. Eso permite escribir una consulta y encontrar directamente una página renderizada de un PDF, sin tener que convertir antes todo su contenido en texto mediante OCR.

El OCR es el sistema que reconoce letras en imágenes o documentos escaneados. Aunque resulta útil, puede cometer errores y suele perder parte de la información visual, como:

  • La posición de una cifra dentro de una tabla.
  • La relación entre un gráfico y su explicación.
  • El diseño de una página o una diapositiva.
  • La estructura espacial de formularios y documentos escaneados.

En la práctica, esto puede servir para buscar una cifra dentro de un informe financiero, localizar una diapositiva concreta en una presentación o encontrar una página escaneada aunque su texto no haya sido reconocido correctamente.

Los modelos también permiten buscar imágenes naturales, como fotografías, aunque Perplexity señala que su uso principal será la búsqueda de documentos visuales.

Un modelo grande para indexar y uno pequeño para consultar

Una de las características más útiles es que las versiones de 0.6B y 9B comparten el mismo espacio de embeddings. Esto significa que una empresa puede crear el índice de documentos con el modelo grande y realizar las búsquedas diarias con el pequeño.

El índice es la estructura que organiza los documentos para encontrarlos rápidamente. Crear ese índice ocurre normalmente una vez, mientras que codificar consultas sucede cada vez que alguien realiza una búsqueda.

Así, una configuración práctica sería:

  • Usar pplx-embed-v2-late-9b para procesar los documentos una sola vez.
  • Usar pplx-embed-v2-late-0.6b para convertir cada consulta en tiempo real.
  • Mantener la calidad del índice grande sin pagar el coste del modelo grande en cada búsqueda.

En las pruebas de Perplexity, esta configuración mejoró 1,6 puntos porcentuales el promedio de 72 tareas de búsqueda especializadas frente a usar el modelo pequeño para todo. En el benchmark visual ViDoRe V3 pasó de 62,3% a 63,5%.

Qué dicen las pruebas

Perplexity evaluó los modelos en búsqueda de texto, documentos visuales, imágenes y tareas en las que un agente de IA necesita recuperar información antes de responder.

En su benchmark web Q2D-Web, basado en unos 190 millones de documentos y cerca de 70.000 consultas, los modelos obtuvieron una puntuación de recuperación del 74,8% para 9B y 73,6% para 0.6B, frente al 69,3% del resultado anterior más alto que compararon.

En ViDoRe V3, centrado en buscar información dentro de páginas visuales, el modelo de 9B logró 65,2% y el de 0.6B 62,3%. Perplexity destaca especialmente el resultado del modelo pequeño, que activó unos 340 millones de parámetros al procesar imágenes, pese a competir con sistemas mucho mayores.

En preguntas complejas sobre documentos, el modelo de 9B alcanzó 92,4% de precisión en MADQA, una prueba con 800 PDFs y más de 18.000 páginas. El modelo de 0.6B obtuvo 90,1%.

La contrapartida: más calidad, más almacenamiento

Los embeddings de múltiples vectores son más expresivos, pero también más caros de almacenar y comparar. Un sistema tradicional guarda un vector por documento. Este enfoque guarda vectores para muchos tokens, por lo que el coste crece con la longitud del contenido.

Eso hace que no sea una sustitución automática para cualquier buscador. Para corpus enormes y consultas muy rápidas, los embeddings de un solo vector pueden seguir siendo más sencillos y baratos. Los nuevos modelos tienen más sentido cuando importan los detalles, el contexto y la información visual.

Los dos modelos se entrenaron con 186 millones de pares de consulta y documento, procedentes de 594 conjuntos de datos en 46 idiomas. Perplexity afirma que excluyó los datos asociados a los benchmarks utilizados para medirlos, con el objetivo de evitar que las pruebas favorecieran artificialmente a sus propios modelos.

Para ti, el cambio más visible no está en la interfaz de una búsqueda, sino en lo que puede encontrar por debajo: datos que viven en una tabla, una imagen o el diseño de una página y que antes podían perderse al convertir el documento en texto. El siguiente paso será ver cómo se comportan estos modelos cuando Perplexity los integre en su API y en sistemas de búsqueda que operen a gran escala.