Il 7 ottobre 2026 Perplexity ha annunciato pplx-embed-v2-late, una famiglia di modelli multimodali per la ricerca in testi e immagini, nelle varianti 0.6B e 9B. In occasione dell’annuncio, Perplexity ha dichiarato che entrambe erano disponibili pubblicamente su Hugging Face. La novità tecnica è la late interaction: invece di condensare ogni input in un solo vettore, il sistema conserva rappresentazioni per i singoli token e le confronta durante la ricerca.

Due modelli per cercare testo e immagini

Un embedding trasforma un input in una rappresentazione numerica che può essere confrontata con altre per recuperare contenuti pertinenti. I modelli pplx-embed-v2-late rappresentano testo e immagini e, secondo Perplexity, supportano ricerche da testo verso immagini e documenti visuali.

Le due varianti sono pplx-embed-v2-late-0.6b e pplx-embed-v2-late-9b. Perplexity descrive la famiglia come un sistema di recupero basato sulla late interaction, un approccio che mantiene più vettori per ciascun input anziché ridurlo a un’unica rappresentazione.

Come funziona la late interaction

Perplexity ha presentato pplx-embed-v2-late per cercare testo e immagini

Ogni token viene trasformato in un vettore di 128 dimensioni. Quando arriva una query, MaxSim confronta i token della query con quelli del documento: per ciascun token della query seleziona la corrispondenza più forte e combina i punteggi ottenuti. Così il sistema può valutare somiglianze tra parti specifiche dei due input, non soltanto tra due vettori riassuntivi.

Perplexity segnala un compromesso pratico: conservare più vettori per documento richiede più spazio di archiviazione e più lavoro per assegnare un punteggio ai candidati rispetto al recupero denso basato su un singolo vettore. L’entità del costo dipende dalla lunghezza dei documenti e dalle scelte di implementazione.

Un indice 9B può ricevere query dal modello 0.6B

Le due varianti condividono lo stesso spazio di embedding. Perplexity afferma quindi che pplx-embed-v2-late-0.6b può codificare le query da confrontare con un indice creato usando pplx-embed-v2-late-9b: il modello grande prepara l’indice, mentre quello più piccolo gestisce le query.

Perplexity ha riportato anche un risultato ViDoRe v3 per questa configurazione mista: con il 9B sull’indice e lo 0.6B per le query, il punteggio sul recupero di immagini è stato del 63,5% in nDCG@10. Nella configurazione simmetrica con lo 0.6B sia per l’indice sia per le query, il risultato riportato è del 62,3%. Il valore del 63,5% riguarda dunque l’uso combinato delle due varianti.

Che cosa misurano i risultati di ViDoRe v3

Perplexity ha pubblicato risultati distinti per immagini e contenuti in Markdown. nDCG@10 è una misura normalizzata della qualità dell’ordinamento dei primi dieci risultati, che considera sia la rilevanza dei documenti sia la loro posizione.

VarianteViDoRe v3: immagini, nDCG@10ViDoRe v3: Markdown, nDCG@10
pplx-embed-v2-late-0.6b62,3%61,2%
pplx-embed-v2-late-9b65,2%64,7%

Sono valutazioni pubblicate da Perplexity per quei compiti specifici: i punteggi descrivono il ranking dei risultati nelle prove indicate. L’esito varia con il tipo di contenuto e con la configurazione di indicizzazione e query.

Pagine visuali e limiti degli input

Perplexity descrive un flusso in cui le pagine di un PDF vengono renderizzate come immagini e recuperate senza OCR né testo estratto. Per la codifica, il modello usa input immagine; il processo prevede batch separati, uno per il testo e uno per le immagini.

L’integrazione nativa con Sentence Transformers richiede sentence-transformers versione 6.0.0 o successiva e transformers versione 5.4.0 o successiva.