Le 7 octobre 2026, Perplexity a annoncé la famille de modèles pplx-embed-v2-late, destinée à retrouver des informations dans le texte et les images. L’entreprise a indiqué que les variantes pplx-embed-v2-late-0.6b et pplx-embed-v2-late-9b étaient disponibles sur Hugging Face.
Comment fonctionne l’interaction tardive ?
Un modèle d’embeddings transforme une entrée en vecteurs numériques que l’on peut comparer pour retrouver des contenus pertinents. La plupart des systèmes dits « denses » résument une entrée par un seul vecteur ; l’interaction tardive en conserve plusieurs, associés aux tokens — les unités de texte traitées par le modèle.
Dans pplx-embed-v2-late, chaque token est représenté par un vecteur de 128 dimensions. Pour comparer une requête et un document, MaxSim repère, pour chaque token de la requête, sa meilleure correspondance parmi les tokens du document, puis additionne les similarités retenues. Le score tient ainsi compte des correspondances entre éléments précis plutôt que d’une représentation unique de chaque entrée.
Perplexity distingue cette approche des embeddings contextuels, qui ajoutent du contexte aux segments d’un document. La famille pplx-embed-v2-late est la branche multimodale à interaction tardive : elle traite le texte et les images. Perplexity indique avoir entraîné les modèles à partir de 186 millions de paires requête-document issues de 594 jeux de données en 46 langues.
Un index 9B peut être interrogé avec le modèle 0.6B
Les deux variantes partagent le même espace d’embeddings. Perplexity indique donc que pplx-embed-v2-late-0.6b peut encoder les requêtes destinées à un corpus indexé avec pplx-embed-v2-late-9b. L’indexation et la recherche peuvent ainsi s’appuyer sur des tailles de modèles différentes ; Perplexity présente cette configuration comme un moyen de réduire le calcul nécessaire au moment des requêtes.
Ce que montrent les résultats ViDoRe v3
Perplexity publie des résultats sur deux tâches de ViDoRe v3 : la recherche à partir de pages sous forme d’images et celle à partir de documents convertis en Markdown. La métrique nDCG@10 mesure la qualité du classement des dix premiers résultats en tenant compte de leur pertinence et de leur position.
| Variante | ViDoRe v3 : images, nDCG@10 | ViDoRe v3 : Markdown, nDCG@10 |
pplx-embed-v2-late-0.6b | 62,3 % | 61,2 % |
pplx-embed-v2-late-9b | 65,2 % | 64,7 % |
Ces scores correspondent aux tâches et aux évaluations publiées par Perplexity. Ils permettent de comparer les deux variantes dans ces conditions précises : la version 9B obtient un score plus élevé sur chacune des deux tâches présentées.
Pages visuelles et limites des entrées
Perplexity indique que des pages de documents, notamment celles d’un PDF, peuvent être recherchées une fois rendues sous forme d’images, sans OCR ni texte extrait. Le flux décrit repose donc sur des pages-image comme entrées. Dans l’interface documentée, les lots contenant du texte et ceux contenant des images sont traités séparément.
La configuration indiquée requiert sentence-transformers >= 6.0.0 et transformers >= 5.4.0. L’interaction tardive conserve de nombreux vecteurs par document : Perplexity signale que cela augmente le stockage des vecteurs et le travail de comparaison des candidats par rapport à une recherche dense à vecteur unique, avec un coût qui dépend de la longueur des documents et des choix de déploiement.