Op 7 oktober 2026 kondigde Perplexity de multimodale retrievalfamilie pplx-embed-v2-late aan. Het bedrijf meldde dat de varianten van 0,6B en 9B parameters op Hugging Face beschikbaar waren. Ze zijn bedoeld om zoekopdrachten in tekst en afbeeldingen te koppelen aan relevante documenten en visuele pagina’s.

Perplexity kondigt multimodale retrievalmodellen aan

Een embeddingmodel zet invoer om in vectoren: numerieke representaties waarmee een zoeksysteem overeenkomsten tussen een vraag en documenten kan bepalen. De modellen van Perplexity verwerken tekst en afbeeldingen en bewaren meerdere vectoren per invoer, in plaats van alles samen te persen tot één vector.

Perplexity zegt dat de modellen zijn getraind op 186 miljoen vraag-documentparen uit 594 datasets in 46 talen. Daarbij zijn de varianten van 0,6B en 9B gedistilleerd uit een model met 18 miljard parameters.

Zo werken late interaction en MaxSim

Perplexity kondigt pplx-embed-v2-late aan voor multimodaal zoeken

Bij late interaction vergelijkt het model tokens uit de zoekopdracht afzonderlijk met tokens uit een document. Tokens zijn de kleine tekst- of beeldeenheden die het model verwerkt. Voor elk token uit de zoekopdracht selecteert MaxSim de sterkste overeenkomst met een documenttoken; de geselecteerde scores worden vervolgens gecombineerd. De modellen gebruiken vectoren van 128 dimensies per token.

Doordat het systeem veel vectoren per document bewaart en vergelijkt, vraagt late interaction meer opslag en scoringswerk dan zoeken met één vector per document. Hoeveel extra werk dat oplevert, hangt volgens Perplexity af van de documentlengte en de inrichting van het systeem.

Het 0,6B-model kan zoekopdrachten verwerken voor een 9B-index

De varianten delen volgens Perplexity dezelfde embeddingsruimte. Daardoor kan het 9B-model de documenten indexeren, terwijl het kleinere 0,6B-model de zoekopdrachten codeert. Dat kan het rekenwerk tijdens het zoeken verminderen, terwijl de index met het grotere model is gemaakt.

Perplexity rapporteerde voor ViDoRe v3 bij afbeeldingszoekopdrachten een score van 62,3% met zowel het 0,6B-model voor de index als voor de zoekopdracht. In een andere opstelling, met een 9B-index en zoekopdrachten gecodeerd door het 0,6B-model, rapporteerde het bedrijf 63,5%.

Wat de ViDoRe v3-resultaten meten

De modelkaarten rapporteren voor beide varianten nDCG@10: een maat voor de kwaliteit van de rangschikking van de eerste tien zoekresultaten, waarbij de positie en relevantie van resultaten meetellen. De cijfers verschillen per model en taak.

ModelvariantAfbeeldingen, nDCG@10Markdown, nDCG@10
0,6B62,3%61,2%
9B65,2%64,7%

Deze scores zijn evaluaties van de modellen op twee afzonderlijke ViDoRe v3-taken, zoals gepubliceerd door Perplexity. De afbeeldingstaak gebruikt visuele pagina’s; de Markdown-taak gebruikt documenten in Markdown-vorm.

Visuele documentpagina’s en invoerbeperkingen

Perplexity zegt dat gerenderde PDF-pagina’s als afbeeldingen kunnen worden doorzocht zonder OCR of uitgelezen tekst. OCR is software die tekst uit een afbeelding herkent. Voor deze werkwijze worden de pagina’s als afbeeldingen aangeleverd.

De beschreven modelinterface verwerkt tekst en afbeeldingen in afzonderlijke batches; één batch met beide soorten invoer wordt niet ondersteund. Voor de integratie met Sentence Transformers noemt de modelkaart sentence-transformers >= 6.0.0 en transformers >= 5.4.0 als softwarevereisten.