Perplexity kündigte am 7. Oktober 2026 die multimodalen Suchmodelle pplx-embed-v2-late-0.6b und pplx-embed-v2-late-9b an. Das Unternehmen erklärte, beide Varianten seien öffentlich auf Hugging Face verfügbar. Sie sollen die Suche in Texten und Bildern ermöglichen und vergleichen dafür einzelne Token-Vektoren statt jede Eingabe auf einen einzigen Vektor zu verdichten.
Wie Late Interaction und MaxSim funktionieren
Ein Embedding bildet eine Eingabe als Zahlenvektor ab, den ein Suchsystem zum Finden ähnlicher Inhalte nutzen kann. Bei der sogenannten Late Interaction bleibt es nicht bei einem einzigen Vektor: Das Modell erzeugt für jedes Token einen 128-dimensionalen Vektor. Ein Token ist dabei eine Einheit des Textes, etwa ein Wort oder Wortteil.
Beim Abgleich sucht jedes Token der Anfrage nach dem passendsten Token im Dokument. MaxSim nimmt für jedes Anfrage-Token den stärksten Treffer und kombiniert diese Einzelwerte zu einer Gesamtwertung. So bleiben auch Teilübereinstimmungen zwischen Anfrage und Dokument erhalten.
Perplexity unterscheidet diesen Ansatz von Embeddings, die einen Text in einem einzelnen Vektor zusammenfassen, und von kontextuellen Embeddings, die Textabschnitte um Dokumentkontext ergänzen. Die Kehrseite der vielen Token-Vektoren: Für Dokumente fällt mehr Speicher an, und das Bewerten möglicher Treffer erfordert mehr Rechenarbeit als bei der Suche mit Einzelvektoren. Der Aufwand hängt unter anderem von der Dokumentlänge und der gewählten Umsetzung ab.
Ein 0,6B-Modell kann einen 9B-Index abfragen
Die beiden Modellgrößen verwenden laut Perplexity denselben Einbettungsraum. Deshalb kann das 9B-Modell den Dokumentbestand indexieren, während das kleinere 0,6B-Modell die Suchanfragen codiert. Perplexity zufolge kann diese Aufteilung den Rechenaufwand auf der Abfrageseite verringern.
Der Vorteil für die Anfrageverarbeitung beseitigt nicht den zusätzlichen Aufwand des Late-Interaction-Ansatzes beim Speichern und Bewerten von Dokumentvektoren. Die Wahl der Konfiguration betrifft also zwei verschiedene Aufgaben: das Erstellen des Indexes und das Codieren der späteren Suchanfragen.
Was die ViDoRe-v3-Ergebnisse aussagen
Perplexity nennt für beide Modelle Ergebnisse aus dem Benchmark ViDoRe v3. nDCG@10 bewertet, wie weit oben relevante Treffer unter den ersten zehn Ergebnissen erscheinen; ein höherer Wert steht für eine bessere Rangfolge relevanter Treffer. Die Prozentwerte sind Ranking-Scores.
| Modell | Bildsuche: nDCG@10 | Markdown-Suche: nDCG@10 |
pplx-embed-v2-late-0.6b | 62,3 % | 61,2 % |
pplx-embed-v2-late-9b | 65,2 % | 64,7 % |
In diesen beiden Aufgaben liegen die von Perplexity veröffentlichten Werte für das 9B-Modell höher. Die Ergebnisse beziehen sich jeweils auf die angegebene Modellvariante und Aufgabe; sie sagen nicht automatisch voraus, wie die Modelle in einem anderen Suchsystem oder mit anderen Dokumenten abschneiden.
Visuelle Dokumentseiten und Eingabegrenzen
Perplexity beschreibt die Suche in gerenderten PDF-Seiten ohne OCR oder zuvor extrahierten Text. Dafür werden die Seiten als Bilder verarbeitet. Beim dokumentierten Modell-Workflow laufen Text- und Bildinputs in getrennten Batches; ein gemeinsamer Batch mit beiden Eingabearten wird nicht unterstützt.
Für die dokumentierte Integration nennt Perplexity sentence-transformers ab Version 6.0.0 und transformers ab Version 5.4.0.