Em 24 de setembro de 2026, a Perplexity apresentou sua arquitetura do Photon e anunciou o Fast Search para a Perplexity Search API. O Photon é o motor interno que recupera e classifica páginas candidatas na busca com IA da empresa; segundo a Perplexity, ele já atendia ao tráfego de busca em produção.
Perplexity apresenta o Photon
Photon atua dentro da infraestrutura de busca da Perplexity: seleciona páginas candidatas que seguem para as etapas posteriores do serviço. A empresa o descreve como parte da transição de sua infraestrutura de busca para sistemas próprios baseados em Rust. Não é um mecanismo de busca independente voltado ao consumidor.
Fast Search é uma modalidade da Perplexity Search API baseada no Photon, com uma configuração de classificação ajustada para fluxos de trabalho com agentes. A Perplexity anunciou seu lançamento junto com a apresentação técnica do motor.
O caminho de uma consulta pelo Photon
Uma solicitação passa pelo balanceador de carga até um broker, que escolhe um grupo de shards. Shards são partições do índice; neles, os candidatos são recuperados e classificados. Em seguida, o broker reúne os resultados e busca campos importantes dos documentos selecionados, que retornam à busca da Perplexity.
Construção do índice e atendimento das consultas
A Perplexity separa a construção do índice do atendimento das consultas. Pillar prepara os dados de origem em tabelas do YTsaurus; indexadores montam estruturas para os shards, e um controlador distribui versões do índice entre os grupos que atendem às solicitações.
O desenho também usa representações compactas dos dados, leituras assíncronas em lote com io_uring e um sistema de cache com política de remoção CLOCK. A empresa relata que o Photon usa cerca de 20% menos máquinas de atendimento equivalentes e armazena aproximadamente 2,5 vezes mais dados por documento que o sistema anterior.
O que o p99 divulgado mede
A Perplexity relata que o p99 de produção do fluxo de recuperação e classificação caiu de cerca de 800 ms no sistema anterior para cerca de 65 ms com o Photon. p99 é o tempo dentro do qual se concluem 99% das solicitações medidas. A cifra do Photon cobre suas etapas internas e exclui etapas posteriores da busca da Perplexity.
| Sistema | Latência p99 de produção divulgada | Escopo da medição |
| Sistema anterior | Cerca de 800 ms | Fluxo de recuperação e classificação em produção |
| Photon | Cerca de 65 ms | Etapas internas do motor; etapas posteriores da busca ficam fora da medida |
Fast Search: benchmarks e acesso à API
A latência divulgada para uma chamada individual do Fast Search é de 160 ms no p50 e 230 ms no p95. Esses percentis medem a chamada à API e não o mesmo fluxo interno de produção medido pelo p99 do Photon.
Em seis benchmarks, com 3.554 tarefas selecionadas, a Perplexity relata pontuação de 64,3% para o Fast Search e 64,0% para a configuração padrão. A estimativa de custo de modelo e busca para esse conjunto foi de US$ 59,73 e US$ 187,60, respectivamente. Em testes internos separados com consultas de cauda longa, o Fast Search registrou DCG de 2,21 e disponibilidade de resposta de 0,567; a configuração padrão, 2,45 e 0,596.
| Métrica | Fast Search | Configuração padrão | Contexto |
| Pontuação ponderada por tarefa | 64,3% | 64,0% | Seis benchmarks; 3.554 tarefas selecionadas |
| Custo estimado de modelo e busca | US$ 59,73 | US$ 187,60 | Mesmo conjunto de 3.554 tarefas |
| Relevância DCG | 2,21 | 2,45 | Testes internos de consultas de cauda longa |
| Disponibilidade de resposta | 0,567 | 0,596 | Testes internos de consultas de cauda longa |
A documentação da API lista o Fast Search a US$ 1 por 1.000 solicitações bem-sucedidas, ante US$ 5 para a busca padrão. Para usar a modalidade, a solicitação POST /search recebe o parâmetro search_type: "fast"; max_results aceita valores de 1 a 20.