Jalapeño è l’acceleratore personalizzato che OpenAI ha progettato per l’inferenza dei modelli linguistici: la fase in cui un modello già addestrato genera risposte. OpenAI afferma che i propri modelli hanno assistito alcune attività di progettazione, ottimizzazione e verifica. L’azienda ha sviluppato il chip con Broadcom, mentre Celestica ha contribuito all’integrazione del sistema. La presentazione di Jalapeño e il suo ruolo nell’inferenza.

Dove hanno aiutato i modelli

OpenAI afferma che i suoi modelli hanno aiutato gli ingegneri a esplorare diverse implementazioni, abbreviare i cicli di progettazione, misurazione e verifica e ottimizzare circuiti aritmetici.

Il contributo si è concentrato soprattutto sulle attività front-end, cioè sulle fasi iniziali e più simili alla programmazione. Nel flusso di lavoro figurava XLS, una toolchain di sintesi ad alto livello: un sistema che traduce descrizioni funzionali in progetti hardware. Questo tipo di lavoro offriva un terreno adatto all’assistenza dei modelli; le decisioni ingegneristiche restavano in mano alle persone.

I ruoli di OpenAI, Broadcom e degli ingegneri

OpenAI ha guidato la progettazione del sistema nel suo insieme. Broadcom ha curato l’implementazione del silicio e gran parte della progettazione fisica, dalle porte logiche in poi. Celestica ha contribuito all’integrazione di schede, rack e sistema.

Gli ingegneri di OpenAI sono rimasti responsabili delle decisioni progettuali. Il gruppo di progettazione di OpenAI ha avuto in media meno di 100 persone, senza contare il personale di Broadcom.

Che cosa misurano i tempi di sviluppo

Il percorso dai primi RTL al tape-out è durato nove mesi. RTL, acronimo di Register Transfer Level, indica una descrizione del funzionamento digitale del chip; il tape-out è l’invio del progetto definitivo alla fabbricazione. Dal concept architetturale al primo silicio sono invece passati meno di 20 mesi. I due intervalli partono da fasi diverse e hanno traguardi distinti.

OpenAI e Broadcom hanno annunciato Jalapeño il 24 giugno 2026 come acceleratore per l’inferenza dei modelli linguistici.