Em 24 de setembro de 2026, a Perplexity apresentou sua arquitetura do Photon e anunciou o Fast Search para a Perplexity Search API. O Photon é o motor interno que recupera e classifica páginas candidatas na busca com IA da empresa; segundo a Perplexity, ele já atendia ao tráfego de busca em produção.

Perplexity apresenta o Photon

Photon atua dentro da infraestrutura de busca da Perplexity: seleciona páginas candidatas que seguem para as etapas posteriores do serviço. A empresa o descreve como parte da transição de sua infraestrutura de busca para sistemas próprios baseados em Rust. Não é um mecanismo de busca independente voltado ao consumidor.

Fast Search é uma modalidade da Perplexity Search API baseada no Photon, com uma configuração de classificação ajustada para fluxos de trabalho com agentes. A Perplexity anunciou seu lançamento junto com a apresentação técnica do motor.

O caminho de uma consulta pelo Photon

Perplexity apresenta Photon e relata p99 de 65 ms

Uma solicitação passa pelo balanceador de carga até um broker, que escolhe um grupo de shards. Shards são partições do índice; neles, os candidatos são recuperados e classificados. Em seguida, o broker reúne os resultados e busca campos importantes dos documentos selecionados, que retornam à busca da Perplexity.

Construção do índice e atendimento das consultas

A Perplexity separa a construção do índice do atendimento das consultas. Pillar prepara os dados de origem em tabelas do YTsaurus; indexadores montam estruturas para os shards, e um controlador distribui versões do índice entre os grupos que atendem às solicitações.

O desenho também usa representações compactas dos dados, leituras assíncronas em lote com io_uring e um sistema de cache com política de remoção CLOCK. A empresa relata que o Photon usa cerca de 20% menos máquinas de atendimento equivalentes e armazena aproximadamente 2,5 vezes mais dados por documento que o sistema anterior.

O que o p99 divulgado mede

A Perplexity relata que o p99 de produção do fluxo de recuperação e classificação caiu de cerca de 800 ms no sistema anterior para cerca de 65 ms com o Photon. p99 é o tempo dentro do qual se concluem 99% das solicitações medidas. A cifra do Photon cobre suas etapas internas e exclui etapas posteriores da busca da Perplexity.

SistemaLatência p99 de produção divulgadaEscopo da medição
Sistema anteriorCerca de 800 msFluxo de recuperação e classificação em produção
PhotonCerca de 65 msEtapas internas do motor; etapas posteriores da busca ficam fora da medida

Fast Search: benchmarks e acesso à API

A latência divulgada para uma chamada individual do Fast Search é de 160 ms no p50 e 230 ms no p95. Esses percentis medem a chamada à API e não o mesmo fluxo interno de produção medido pelo p99 do Photon.

Em seis benchmarks, com 3.554 tarefas selecionadas, a Perplexity relata pontuação de 64,3% para o Fast Search e 64,0% para a configuração padrão. A estimativa de custo de modelo e busca para esse conjunto foi de US$ 59,73 e US$ 187,60, respectivamente. Em testes internos separados com consultas de cauda longa, o Fast Search registrou DCG de 2,21 e disponibilidade de resposta de 0,567; a configuração padrão, 2,45 e 0,596.

MétricaFast SearchConfiguração padrãoContexto
Pontuação ponderada por tarefa64,3%64,0%Seis benchmarks; 3.554 tarefas selecionadas
Custo estimado de modelo e buscaUS$ 59,73US$ 187,60Mesmo conjunto de 3.554 tarefas
Relevância DCG2,212,45Testes internos de consultas de cauda longa
Disponibilidade de resposta0,5670,596Testes internos de consultas de cauda longa

A documentação da API lista o Fast Search a US$ 1 por 1.000 solicitações bem-sucedidas, ante US$ 5 para a busca padrão. Para usar a modalidade, a solicitação POST /search recebe o parâmetro search_type: "fast"; max_results aceita valores de 1 a 20.