O Grok 4.7 foi lançado pela xAI em 21 de setembro de 2026 com foco em programação, trabalho intelectual e fluxos de trabalho com agentes. A nova versão melhora sobre o Grok 4.6 em todos os testes comparáveis da tabela publicada pela empresa, mas não assume a liderança geral: o Fable 5.1 Max fica à frente em várias avaliações de programação e tarefas longas. Na API, os preços iniciais são de US$ 2 por 1 milhão de tokens de entrada e US$ 6 por 1 milhão de tokens de saída.

Grok 4.7 já está disponível para desenvolvedores

A xAI lista o Grok 4.7 no Cursor, no Grok Build, na API da xAI, em ferramentas de programação de terceiros, roteadores de modelos e plataformas de nuvem. O modelo também foi apresentado para tarefas que podem durar várias horas, em vez de responder apenas a solicitações curtas de conversa.

A empresa afirma que o Grok 4.7 usa uma base maior, passou por um ciclo mais longo de aprendizado por reforço e foi treinado com mais peso para problemas difíceis e demorados. A xAI também diz que o modelo entende nativamente o ambiente Grok Bot, criado para organizar fluxos de trabalho com agentes.

A variante rápida oferece o dobro da velocidade de saída pelo dobro do preço. A tarifa padrão continua sendo a referência mais baixa: US$ 2 por milhão de tokens processados na entrada e US$ 6 por milhão de tokens gerados na saída.

O que muda frente ao Grok 4.6

A tabela da xAI mostra avanços do Grok 4.7 sobre o Grok 4.6 em sete avaliações. O salto mais amplo aparece no Terminal-Bench 4.0, voltado a tarefas realizadas em ambiente de terminal: o modelo novo marcou 38,0%, contra 20,3% do antecessor.

AvaliaçãoGrok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
CursorBench 4.046,3%40,4%41,7%51,8%
DeepSWE v1.171,0%65,2%72,7%70,0%
EEBench64,0%53,0%39,4%56,4%
AA Briefcase v1.11.6571.5461.4871.678
Terminal-Bench 4.038,0%20,3%37,3%57,9%
Harvey Legal Agent Benchmark19,6%15,8%2,5%6,7%
HealthBench Professional56,7%48,5%60,5%62,1%

Os números usam as configurações indicadas na própria tabela, como xHigh, High e Max. Eles medem tarefas específicas, não o desempenho universal dos modelos em qualquer projeto.

O Grok 4.7 lidera os modelos listados no Harvey Legal Agent Benchmark, com 19,6%, e no EEBench, com 64,0%. Já o Fable 5.1 Max fica à frente no CursorBench 4.0, no AA Briefcase v1.1, no Terminal-Bench 4.0 e no HealthBench Professional. No DeepSWE v1.1, o GPT-5.6 Sol Max alcança 72,7%, acima dos 71,0% do Grok 4.7.

O modelo foi pensado para fluxos com agentes?

Sim. A xAI diz que o Grok 4.7 entende nativamente o ambiente Grok Bot. Nesse tipo de fluxo, agentes recebem papéis diferentes — como gerenciamento de projeto, desenvolvimento e design — e trabalham em etapas de uma mesma tarefa.

Isso torna o modelo especialmente interessante para quem pretende combinar planejamento, programação e uso de ferramentas. A capacidade anunciada, porém, não transforma cada fluxo automatizado em um processo confiável por definição: o resultado ainda depende da tarefa, das ferramentas e das instruções usadas.

Preço por token não é custo por tarefa

A API do Grok 4.7 parte de US$ 2 por 1 milhão de tokens de entrada e US$ 6 por 1 milhão de tokens de saída. Esses valores facilitam a comparação entre tarifas, mas não revelam sozinhos quanto custa concluir um trabalho.

Dados relacionados ao Artificial Analysis apontam que o Grok 4.7 xHigh usou aproximadamente 81.000 tokens de saída por tarefa no Intelligence Index. O Grok 4.6 High usou cerca de 36.000, enquanto o GPT-6 Astra Max ficou em torno de 27.000 no mesmo tipo de observação.

Na prática, dois modelos com preços diferentes por token podem ter custos totais mais próximos — ou mais distantes — conforme a quantidade de tokens gerada, o modo de raciocínio e o fluxo de ferramentas. A tarifa da API, portanto, é um ponto de partida, não um ranking universal de custo por tarefa. Para contexto sobre preços de APIs de modelos, veja também a análise do preço da API do DeepSeek.

Onde o Grok 4.7 faz mais sentido

O lançamento da xAI é mais convincente para quem precisa de programação, análise técnica e tarefas longas e aceita escolher o modelo conforme o tipo de trabalho. O Grok 4.7 melhora claramente sobre o Grok 4.6 nos testes listados, com destaque para Terminal-Bench 4.0, EEBench e Harvey Legal Agent Benchmark.

Para fluxos em que o desempenho máximo em programação ou em tarefas de terminal é a prioridade, os números da própria xAI colocam o Fable 5.1 Max à frente em várias avaliações. Para quem calcula orçamento, o preço inicial do Grok 4.7 é competitivo, mas o consumo efetivo de tokens precisa entrar na conta.

A xAI apresentou, assim, uma atualização com ganhos concretos sobre o Grok 4.6 e uma tarifa inicial agressiva — não um modelo líder em todos os tipos de trabalho.