Il 27 settembre 2026 The Call Center Doctors ha riferito di aver provato DeepSeek V4.1 Flash per circa tre ore su un server a noleggio con quattro GPU Nvidia H200. Per il carico di programmazione considerato, la società ha stimato 440,88 dollari al giorno per il noleggio on-demand, contro 184–223 dollari al giorno per il lavoro equivalente via API DeepSeek, ipotizzando il server a pieno carico. Nel test DeepSeek non ha scritto codice: è stato usato soltanto per le revisioni in sola lettura.
Il costo giornaliero del noleggio e dell’API
Il server costava 18,37 dollari l’ora con la tariffa on-demand e 9,19 dollari l’ora con quella spot. La prima si applicava anche quando le GPU restavano inattive; con la seconda il provider poteva riprendere la capacità. La stima API della società riguardava il lavoro che un server pienamente occupato avrebbe svolto in una giornata.
| Opzione | Costo al giorno | Base di calcolo | Condizione |
| Noleggio on-demand, quattro H200 | 440,88 dollari | 18,37 dollari l’ora per 24 ore | Addebitato anche se il server è inattivo |
| Noleggio spot, quattro H200 | Circa 220 dollari | 9,19 dollari l’ora per 24 ore | Il provider può riprendere la capacità |
| Lavoro equivalente via API DeepSeek | 184–223 dollari, secondo la stima | Token del carico di lavoro valutati alle tariffe API | Stima per una giornata a pieno carico |
Per il test di circa tre ore, la società ha indicato una spesa di circa 55 dollari alla tariffa ordinaria o 28 dollari a quella spot. Il confronto giornaliero, quindi, non è il costo effettivamente pagato per quelle tre ore: proietta su 24 ore il costo del server e il valore API del carico modellato.
La pagina dei prezzi di DeepSeek distingue tra input non in cache, input già in cache e token generati. Per DeepSeek-V4.1-Flash, le tariffe indicate nelle fasce non di punta sono 0,15 dollari per milione di token di input non in cache, 0,003 dollari per milione di input in cache e 0,60 dollari per milione di token generati. Nelle fasce di punta, dal lunedì al venerdì, i prezzi raddoppiano; gli orari indicati sono dalle 01:00 alle 04:00 e dalle 06:00 alle 10:00 UTC. La precedente copertura di NeoTeo spiega come la cache incide sul costo dell’API di DeepSeek V4.1 Flash.
Le riletture in cache caratterizzavano il carico
I dati di Claude Code usati per la stima coprivano il periodo dal 1° al 27 settembre 2026, non la durata del test GPU. In quei registri, The Call Center Doctors ha contato 388,5 miliardi di token letti, di cui 374,2 miliardi erano riletture in cache, e 393 milioni di token scritti. Le riletture rappresentavano circa il 96,3% dei token letti.
Questo profilo aiuta a spiegare perché la distinzione tra token in cache e nuovi input pesi nel calcolo: il carico inviava ripetutamente il contesto già presente. Nel modello della società, il costo API dipendeva quindi anche dalla quota di token riutilizzati, oltre che dagli input nuovi e dall’output.
DeepSeek ha revisionato il codice, ma non lo ha scritto
The Call Center Doctors ha tenuto offline gli agenti builder per timori legati a possibili fughe dal sandbox, l’ambiente isolato in cui gira il codice degli agenti. DeepSeek è stato impiegato al loro posto come revisore in sola lettura. La società ha riferito di aver usato da 48 a 64 agenti revisori, che hanno letto 2.377 cartelle e segnalato 32 bug.
Che cosa significa «80 volte più economico»
La formula «80 volte più economico» riguarda il confronto tra prezzi di listino per token; non misura il costo di un’attività di programmazione completata né un risparmio equivalente sugli abbonamenti. Per il periodo dal 1° al 27 settembre, The Call Center Doctors ha riferito una spesa di circa 5.500 dollari per gli abbonamenti Claude Code e ha stimato tra 3.500 e 7.000 dollari per un uso equivalente dell’API DeepSeek, con una media stimata di circa 4.200 dollari. Sono basi di fatturazione diverse: una spesa per abbonamento e un costo API calcolato sul consumo di token.