Il 21 settembre 2026 xAI ha lanciato Grok 4.7, un modello orientato alla programmazione, al lavoro della conoscenza e ai flussi con agenti. Rispetto a Grok 4.6, migliora in diversi test pubblicati da xAI e mantiene un prezzo API di partenza di 2 dollari per un milione di token in ingresso e 6 dollari per un milione di token in uscita. Il quadro, però, non è quello di un vincitore assoluto: Fable 5.1 Max resta avanti in più prove di coding e lavoro lungo.
Grok 4.7 è disponibile per API, coding e flussi con agenti
xAI indica Grok 4.7 come disponibile tramite Cursor, Grok Build, l'API di xAI, gli harness di coding di terze parti, i router di modelli e le piattaforme cloud. Il modello è pensato per affrontare attività che possono durare ore, non soltanto per rispondere rapidamente a una singola richiesta.
Il prezzo API standard parte da 2 dollari per ogni milione di token elaborati in ingresso e da 6 dollari per ogni milione di token generati in uscita. xAI indica inoltre una variante rapida con velocità di generazione doppia e prezzi doppi rispetto alla tariffa standard.
Questi sono prezzi di listino API espressi in dollari. Il loro valore riguarda il consumo dei token, non un abbonamento italiano né il costo complessivo di un progetto.
Cosa cambia rispetto a Grok 4.6
xAI descrive Grok 4.7 come un modello di base nuovo e più grande, addestrato con una sessione di reinforcement learning più lunga e con maggiore peso ai problemi che richiedono molte ore di lavoro. Il reinforcement learning è una tecnica che usa il risultato delle attività per orientare il comportamento del modello durante l'addestramento.
L'azienda afferma inoltre che Grok 4.7 verifica meglio il proprio lavoro, gestisce contesti più lunghi e comprende nativamente l'harness Grok Bot, cioè l'ambiente che coordina gli agenti software. In questo tipo di flusso, un sistema può assegnare ruoli diversi — per esempio gestione del progetto, sviluppo e design — e farli lavorare sullo stesso obiettivo.
La differenza pratica è importante: un modello per attività lunghe deve mantenere il contesto, pianificare più passaggi e correggere il risultato. Le prestazioni di una singola risposta non bastano a descrivere questo tipo di utilizzo.
Dove migliora e dove resta indietro
La tabella ufficiale di xAI confronta Grok 4.7 xHigh con Grok 4.6 High, GPT-5.6 Sol Max e Fable 5.1 Max. Le modalità indicate non sono identiche in ogni nome, quindi i risultati vanno letti insieme alla configurazione riportata.
| Benchmark | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
| CursorBench 4.0 | 46,3% | 40,4% | 41,7% | 51,8% |
| DeepSWE v1.1 | 71,0% | 65,2% | 72,7% | 70,0% |
| EEBench | 64,0% | 53,0% | 39,4% | 56,4% |
| AA Briefcase v1.1 | 1.657 | 1.546 | 1.487 | 1.678 |
| Terminal-Bench 4.0 | 38,0% | 20,3% | 37,3% | 57,9% |
| Harvey Legal Agent Benchmark | 19,6% | 15,8% | 2,5% | 6,7% |
| HealthBench Professional | 56,7% | 48,5% | 60,5% | 62,1% |
Il salto più vistoso rispetto a Grok 4.6 compare in Terminal-Bench 4.0, dove Grok 4.7 passa dal 20,3% al 38,0%. Anche CursorBench, EEBench, AA Briefcase, Harvey Legal Agent Benchmark e HealthBench Professional mostrano valori superiori per il nuovo modello. Su DeepSWE v1.1, invece, Grok 4.7 arriva al 71,0%, mentre GPT-5.6 Sol Max raggiunge il 72,7%.
Grok 4.7 è davanti ai modelli elencati nella tabella su Harvey Legal Agent Benchmark ed EEBench. Fable 5.1 Max lo supera invece su CursorBench 4.0, AA Briefcase v1.1, Terminal-Bench 4.0 e HealthBench Professional. La risposta alla domanda più ovvia, quindi, è no: Grok 4.7 non ha superato tutti i rivali.
I punteggi descrivono le condizioni dei rispettivi test. Non sono una classifica universale di affidabilità per ogni progetto software, documento o attività professionale.
Il prezzo per token non è il costo di una tarefa
Il listino di xAI sembra aggressivo se confrontato con i prezzi API riportati nella stessa tabella: GPT-5.6 Sol Max è indicato a 4 dollari per un milione di token in ingresso e 20 dollari in uscita, mentre Fable 5.1 Max è indicato a 10 dollari in ingresso e 50 dollari in uscita. Grok 4.6 mantiene i 2 dollari in ingresso e i 6 dollari in uscita di Grok 4.7.
Ma il conto reale dipende anche da quanti token il modello usa per completare il lavoro. Dati attribuiti ad Artificial Analysis riportano circa 81.000 token di output per attività per Grok 4.7 nell'Intelligence Index, contro circa 36.000 per Grok 4.6 e 27.000 per GPT-6 Astra. Si tratta di una misura di consumo osservata in quel tipo di attività, non di una tariffa per tutti i progetti.
Per questo un prezzo unitario più basso non garantisce automaticamente una tarefa completa più economica. Per stimare la spesa di un flusso agentico bisogna considerare almeno il numero di token generati, la modalità di ragionamento, il contesto fornito e il numero di passaggi necessari.
Per quale lavoro ha senso scegliere Grok 4.7
Grok 4.7 appare particolarmente interessante quando servono attività lunghe, uso del terminale, programmazione assistita e flussi organizzati tramite agenti. I risultati ufficiali mostrano un miglioramento netto rispetto a Grok 4.6 in questi ambiti, soprattutto in Terminal-Bench 4.0 e nel lavoro professionale misurato da AA Briefcase v1.1.
Se invece la priorità è ottenere il punteggio più alto possibile in ogni categoria, la tabella di xAI non offre una risposta unica: Fable 5.1 Max resta davanti in quattro delle sette prove riportate, mentre GPT-5.6 Sol Max supera Grok 4.7 su DeepSWE v1.1 e HealthBench Professional.
Il lancio di Grok 4.7 porta quindi una miglioria concreta a prezzo API invariato rispetto a Grok 4.6, ma il vantaggio dipende dal lavoro da svolgere e dal consumo effettivo di token.