O Grok 4.7 foi lançado pela xAI em 21 de setembro de 2026 com foco em programação, trabalho intelectual e fluxos de trabalho com agentes. A nova versão melhora sobre o Grok 4.6 em todos os testes comparáveis da tabela publicada pela empresa, mas não assume a liderança geral: o Fable 5.1 Max fica à frente em várias avaliações de programação e tarefas longas. Na API, os preços iniciais são de US$ 2 por 1 milhão de tokens de entrada e US$ 6 por 1 milhão de tokens de saída.
Grok 4.7 já está disponível para desenvolvedores
A xAI lista o Grok 4.7 no Cursor, no Grok Build, na API da xAI, em ferramentas de programação de terceiros, roteadores de modelos e plataformas de nuvem. O modelo também foi apresentado para tarefas que podem durar várias horas, em vez de responder apenas a solicitações curtas de conversa.
A empresa afirma que o Grok 4.7 usa uma base maior, passou por um ciclo mais longo de aprendizado por reforço e foi treinado com mais peso para problemas difíceis e demorados. A xAI também diz que o modelo entende nativamente o ambiente Grok Bot, criado para organizar fluxos de trabalho com agentes.
A variante rápida oferece o dobro da velocidade de saída pelo dobro do preço. A tarifa padrão continua sendo a referência mais baixa: US$ 2 por milhão de tokens processados na entrada e US$ 6 por milhão de tokens gerados na saída.
O que muda frente ao Grok 4.6
A tabela da xAI mostra avanços do Grok 4.7 sobre o Grok 4.6 em sete avaliações. O salto mais amplo aparece no Terminal-Bench 4.0, voltado a tarefas realizadas em ambiente de terminal: o modelo novo marcou 38,0%, contra 20,3% do antecessor.
| Avaliação | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
| CursorBench 4.0 | 46,3% | 40,4% | 41,7% | 51,8% |
| DeepSWE v1.1 | 71,0% | 65,2% | 72,7% | 70,0% |
| EEBench | 64,0% | 53,0% | 39,4% | 56,4% |
| AA Briefcase v1.1 | 1.657 | 1.546 | 1.487 | 1.678 |
| Terminal-Bench 4.0 | 38,0% | 20,3% | 37,3% | 57,9% |
| Harvey Legal Agent Benchmark | 19,6% | 15,8% | 2,5% | 6,7% |
| HealthBench Professional | 56,7% | 48,5% | 60,5% | 62,1% |
Os números usam as configurações indicadas na própria tabela, como xHigh, High e Max. Eles medem tarefas específicas, não o desempenho universal dos modelos em qualquer projeto.
O Grok 4.7 lidera os modelos listados no Harvey Legal Agent Benchmark, com 19,6%, e no EEBench, com 64,0%. Já o Fable 5.1 Max fica à frente no CursorBench 4.0, no AA Briefcase v1.1, no Terminal-Bench 4.0 e no HealthBench Professional. No DeepSWE v1.1, o GPT-5.6 Sol Max alcança 72,7%, acima dos 71,0% do Grok 4.7.
O modelo foi pensado para fluxos com agentes?
Sim. A xAI diz que o Grok 4.7 entende nativamente o ambiente Grok Bot. Nesse tipo de fluxo, agentes recebem papéis diferentes — como gerenciamento de projeto, desenvolvimento e design — e trabalham em etapas de uma mesma tarefa.
Isso torna o modelo especialmente interessante para quem pretende combinar planejamento, programação e uso de ferramentas. A capacidade anunciada, porém, não transforma cada fluxo automatizado em um processo confiável por definição: o resultado ainda depende da tarefa, das ferramentas e das instruções usadas.
Preço por token não é custo por tarefa
A API do Grok 4.7 parte de US$ 2 por 1 milhão de tokens de entrada e US$ 6 por 1 milhão de tokens de saída. Esses valores facilitam a comparação entre tarifas, mas não revelam sozinhos quanto custa concluir um trabalho.
Dados relacionados ao Artificial Analysis apontam que o Grok 4.7 xHigh usou aproximadamente 81.000 tokens de saída por tarefa no Intelligence Index. O Grok 4.6 High usou cerca de 36.000, enquanto o GPT-6 Astra Max ficou em torno de 27.000 no mesmo tipo de observação.
Na prática, dois modelos com preços diferentes por token podem ter custos totais mais próximos — ou mais distantes — conforme a quantidade de tokens gerada, o modo de raciocínio e o fluxo de ferramentas. A tarifa da API, portanto, é um ponto de partida, não um ranking universal de custo por tarefa. Para contexto sobre preços de APIs de modelos, veja também a análise do preço da API do DeepSeek.
Onde o Grok 4.7 faz mais sentido
O lançamento da xAI é mais convincente para quem precisa de programação, análise técnica e tarefas longas e aceita escolher o modelo conforme o tipo de trabalho. O Grok 4.7 melhora claramente sobre o Grok 4.6 nos testes listados, com destaque para Terminal-Bench 4.0, EEBench e Harvey Legal Agent Benchmark.
Para fluxos em que o desempenho máximo em programação ou em tarefas de terminal é a prioridade, os números da própria xAI colocam o Fable 5.1 Max à frente em várias avaliações. Para quem calcula orçamento, o preço inicial do Grok 4.7 é competitivo, mas o consumo efetivo de tokens precisa entrar na conta.
A xAI apresentou, assim, uma atualização com ganhos concretos sobre o Grok 4.6 e uma tarifa inicial agressiva — não um modelo líder em todos os tipos de trabalho.