El 7 de octubre de 2026, Perplexity anunció pplx-embed-v2-late, una familia de modelos de recuperación multimodal con variantes de 0,6B y 9B. La compañía afirmó que ambas estaban disponibles públicamente en Hugging Face. Su rasgo distintivo es buscar mediante coincidencias entre tokens, tanto en texto como en imágenes y documentos visuales.

Dos tamaños para recuperar texto e imágenes

Un embedding convierte una entrada en vectores numéricos que sirven para comparar consultas y documentos. Los modelos densos suelen condensar cada entrada en un solo vector; los de interacción tardía, como pplx-embed-v2-late, conservan varios vectores asociados a sus tokens y comparan esas representaciones durante la búsqueda.

Perplexity describe esta familia como un sistema de interacción tardía al estilo ColBERT, con vectores de 128 dimensiones por token y una arquitectura basada en Qwen3.5 con atención bidireccional. La compañía dice que los modelos admiten entradas de texto e imágenes, y que permiten buscar texto, imágenes y documentos visuales.

Perplexity también afirma que destiló las dos variantes a partir de un modelo docente de 18B parámetros y las entrenó con 186 millones de pares de consulta y documento, procedentes de 594 conjuntos de datos en 46 idiomas.

Cómo funcionan la interacción tardía y MaxSim

Perplexity presentó pplx-embed-v2-late para buscar texto e imágenes

En la interacción tardía, cada token de la consulta se compara con los tokens del documento. MaxSim selecciona la coincidencia de mayor similitud para cada token de consulta y combina esos valores en una puntuación. Así, la búsqueda conserva señales específicas —en lugar de resumir toda la consulta y el documento en un único vector— para ordenar los resultados.

El método tiene un coste práctico: almacenar varios vectores por documento y puntuar candidatos requiere más almacenamiento y trabajo que la recuperación densa de un solo vector. Perplexity señala que el coste depende de la longitud de los documentos y de las decisiones de despliegue.

Consultas con 0,6B sobre un índice de 9B

Las variantes de 0,6B y 9B comparten un espacio de embeddings. Por eso, Perplexity indica que se puede crear un índice con el modelo de 9B y codificar las consultas con el de 0,6B. El modelo grande se encarga de representar los documentos; el pequeño, de convertir las búsquedas en vectores compatibles con ese índice. Esta configuración puede reducir el cálculo necesario al procesar consultas.

Perplexity comparó esa configuración con una indexación y codificación de consultas hechas con el modelo de 0,6B: en la tarea de recuperación de imágenes de ViDoRe v3, informó de un 63,5 % con el índice de 9B y las consultas de 0,6B, frente a un 62,3 % con el modelo de 0,6B en ambas etapas.

Qué muestran los resultados de ViDoRe v3

Perplexity publicó estas puntuaciones para las dos variantes en ViDoRe v3:

VarianteRecuperación de imágenes, nDCG@10Recuperación de Markdown, nDCG@10
pplx-embed-v2-late-0.6b62,3 %61,2 %
pplx-embed-v2-late-9b65,2 %64,7 %

nDCG@10 mide la calidad del orden de los diez primeros resultados según su relevancia y posición, normalizada frente a un orden ideal. Las columnas corresponden a tareas distintas: una usa imágenes de documentos y la otra documentos convertidos a Markdown. El 65,2 % del modelo de 9B es su resultado en recuperación de imágenes con esa variante; el 63,5 % citado antes corresponde a una configuración diferente, con índice de 9B y consultas de 0,6B.

Páginas visuales y límites de entrada

Perplexity dice que las páginas de documentos renderizadas como imágenes pueden recuperarse sin OCR —reconocimiento óptico de caracteres— ni texto previamente extraído. En el caso de un PDF, ese flujo consiste en pasar sus páginas renderizadas como imágenes al modelo.

La implementación documentada procesa por separado los lotes de texto y los de imágenes; no admite mezclar ambas modalidades en un mismo lote. Para usar la integración con Sentence Transformers, los requisitos de software indicados son sentence-transformers 6.0.0 o posterior y transformers 5.4.0 o posterior.

Perplexity también anunció que incorporaría progresivamente a su API Platform los modelos de interacción tardía, los densos y los contextuales.