Il 27 settembre 2026 The Call Center Doctors ha riferito di aver provato DeepSeek V4.1 Flash per circa tre ore su un server a noleggio con quattro GPU Nvidia H200. Per il carico di programmazione considerato, la società ha stimato 440,88 dollari al giorno per il noleggio on-demand, contro 184–223 dollari al giorno per il lavoro equivalente via API DeepSeek, ipotizzando il server a pieno carico. Nel test DeepSeek non ha scritto codice: è stato usato soltanto per le revisioni in sola lettura.

Il costo giornaliero del noleggio e dell’API

Il server costava 18,37 dollari l’ora con la tariffa on-demand e 9,19 dollari l’ora con quella spot. La prima si applicava anche quando le GPU restavano inattive; con la seconda il provider poteva riprendere la capacità. La stima API della società riguardava il lavoro che un server pienamente occupato avrebbe svolto in una giornata.

OpzioneCosto al giornoBase di calcoloCondizione
Noleggio on-demand, quattro H200440,88 dollari18,37 dollari l’ora per 24 oreAddebitato anche se il server è inattivo
Noleggio spot, quattro H200Circa 220 dollari9,19 dollari l’ora per 24 oreIl provider può riprendere la capacità
Lavoro equivalente via API DeepSeek184–223 dollari, secondo la stimaToken del carico di lavoro valutati alle tariffe APIStima per una giornata a pieno carico

Per il test di circa tre ore, la società ha indicato una spesa di circa 55 dollari alla tariffa ordinaria o 28 dollari a quella spot. Il confronto giornaliero, quindi, non è il costo effettivamente pagato per quelle tre ore: proietta su 24 ore il costo del server e il valore API del carico modellato.

La pagina dei prezzi di DeepSeek distingue tra input non in cache, input già in cache e token generati. Per DeepSeek-V4.1-Flash, le tariffe indicate nelle fasce non di punta sono 0,15 dollari per milione di token di input non in cache, 0,003 dollari per milione di input in cache e 0,60 dollari per milione di token generati. Nelle fasce di punta, dal lunedì al venerdì, i prezzi raddoppiano; gli orari indicati sono dalle 01:00 alle 04:00 e dalle 06:00 alle 10:00 UTC. La precedente copertura di NeoTeo spiega come la cache incide sul costo dell’API di DeepSeek V4.1 Flash.

Le riletture in cache caratterizzavano il carico

I dati di Claude Code usati per la stima coprivano il periodo dal 1° al 27 settembre 2026, non la durata del test GPU. In quei registri, The Call Center Doctors ha contato 388,5 miliardi di token letti, di cui 374,2 miliardi erano riletture in cache, e 393 milioni di token scritti. Le riletture rappresentavano circa il 96,3% dei token letti.

Questo profilo aiuta a spiegare perché la distinzione tra token in cache e nuovi input pesi nel calcolo: il carico inviava ripetutamente il contesto già presente. Nel modello della società, il costo API dipendeva quindi anche dalla quota di token riutilizzati, oltre che dagli input nuovi e dall’output.

DeepSeek ha revisionato il codice, ma non lo ha scritto

The Call Center Doctors ha tenuto offline gli agenti builder per timori legati a possibili fughe dal sandbox, l’ambiente isolato in cui gira il codice degli agenti. DeepSeek è stato impiegato al loro posto come revisore in sola lettura. La società ha riferito di aver usato da 48 a 64 agenti revisori, che hanno letto 2.377 cartelle e segnalato 32 bug.

Che cosa significa «80 volte più economico»

La formula «80 volte più economico» riguarda il confronto tra prezzi di listino per token; non misura il costo di un’attività di programmazione completata né un risparmio equivalente sugli abbonamenti. Per il periodo dal 1° al 27 settembre, The Call Center Doctors ha riferito una spesa di circa 5.500 dollari per gli abbonamenti Claude Code e ha stimato tra 3.500 e 7.000 dollari per un uso equivalente dell’API DeepSeek, con una media stimata di circa 4.200 dollari. Sono basi di fatturazione diverse: una spesa per abbonamento e un costo API calcolato sul consumo di token.