A Perplexity anunciou em 7 de outubro de 2026 a família pplx-embed-v2-late, com variantes identificadas como 0.6B e 9B, e afirmou que ambas estavam disponíveis publicamente no Hugging Face. Os modelos foram projetados para recuperar informações em texto e imagens, comparando tokens individuais em vez de resumir cada entrada em um único vetor.
Perplexity anuncia modelos de busca multimodal
Um embedding transforma uma entrada em representações numéricas que podem ser comparadas para encontrar resultados relevantes. Na família pplx-embed-v2-late, cada token recebe um vetor de 128 dimensões. A Perplexity apresenta os modelos como sistemas de interação tardia, ou late interaction, para recuperar texto, imagens e documentos visuais.
A empresa também distingue essa abordagem de outros métodos de recuperação. Um modelo denso resume cada entrada em um vetor; embeddings contextuais acrescentam contexto a trechos de documentos; já a interação tardia mantém vários vetores e compara tokens da consulta com tokens do documento. Essa comparação mais detalhada tem um custo: guardar vetores por token e pontuar candidatos exige mais armazenamento e processamento do que a recuperação densa de vetor único. O custo depende do tamanho dos documentos e das escolhas de implantação.
Como funcionam a interação tardia e o MaxSim
Na interação tardia, o modelo compara cada token da consulta com os tokens de um documento. O MaxSim seleciona a maior similaridade para cada token da consulta e soma esses valores para formar uma pontuação de correspondência.
A ideia prática é preservar sinais específicos da consulta. Em vez de depender de um único vetor que resuma todo o texto ou a imagem, o sistema pode pontuar correspondências token a token e combiná-las.
Consultas com 0.6B em um índice criado com 9B
As duas variantes compartilham o mesmo espaço de embeddings, segundo a Perplexity. Isso permite criar um índice de documentos com o modelo 9B e usar o modelo 0.6B para codificar as consultas. Assim, a etapa de indexação pode usar a variante maior, enquanto a busca pode recorrer à menor.
A Perplexity também publicou um resultado do ViDoRe v3 para imagens nessa configuração mista: um índice criado com 9B e consultas codificadas com 0.6B obteve 63,5% em nDCG@10. Com o modelo 0.6B tanto para indexar quanto para consultar, o resultado foi 62,3%.
O que mostram os resultados do ViDoRe v3
A Perplexity publicou resultados para as duas variantes em tarefas de recuperação de imagens e de conteúdo convertido para Markdown:
| Variante | ViDoRe v3: imagens, nDCG@10 | ViDoRe v3: Markdown, nDCG@10 |
pplx-embed-v2-late-0.6b | 62,3% | 61,2% |
pplx-embed-v2-late-9b | 65,2% | 64,7% |
nDCG@10 é uma métrica de qualidade da ordenação: avalia a relevância dos dez primeiros resultados e dá mais peso aos que aparecem nas posições mais altas. Os valores publicados são avaliações da Perplexity em tarefas específicas; não representam uma medida universal de desempenho para qualquer conjunto de documentos ou uso.
Páginas visuais e limites de entrada
A Perplexity afirma que páginas renderizadas de documentos, incluindo páginas de PDF, podem ser recuperadas como imagens sem OCR ou texto extraído. O fluxo descrito trata as páginas renderizadas como imagens.
Na integração documentada, as entradas de texto e de imagem são processadas em lotes separados. Uma chamada recebe apenas texto, e outra, apenas imagens; o formato não aceita uma mistura dos dois tipos no mesmo lote. A integração nativa com Sentence Transformers requer sentence-transformers >= 6.0.0 e transformers >= 5.4.0.