La system card di OpenAI datata 7 ottobre 2026 riporta un quadro misto per GPT-6 Sol e GPT-6 Luna: nei test di jailbreak su più turni entrambi hanno ottenuto risultati migliori di GPT-5.6 Sol a ogni budget d’attacco provato, ma alcuni benchmark di sicurezza hanno registrato regressi significativi rispetto ai corrispondenti modelli GPT-5.6 di agosto.

Che cosa riporta la system card di ottobre

I risultati riguardano valutazioni diverse, con metriche e condizioni proprie. Per i jailbreak, OpenAI ha misurato la capacità del difensore di resistere a tentativi d’attacco ripetuti; nei benchmark di sicurezza ha invece valutato categorie di contenuti specifiche, comprese quelle relative all’autolesionismo, alla violenza grafica e ai contenuti sessuali.

Perciò i risultati non si riducono a un unico verdetto sulla sicurezza dei modelli: una prestazione migliore in una valutazione può coesistere con punteggi peggiori in altre.

Il confronto sui jailbreak e i suoi limiti

OpenAI riferisce che GPT-6 Sol e GPT-6 Luna hanno ottenuto un tasso di successo osservato del difensore superiore a quello di GPT-5.6 Sol a ogni budget d’attacco testato. Un attacco multi-turno può sondare il modello e adattare i tentativi in base alle risposte ricevute.

Il confronto con i modelli GPT-6 di settembre è distinto: le stime puntuali delle versioni di ottobre erano leggermente inferiori, ma gli intervalli di confidenza al 95% si sovrapponevano ampiamente. Nei test di jailbreak, i modelli sono stati valutati senza le protezioni della fase di produzione; OpenAI indica che i classificatori di produzione aggiungono un ulteriore livello di protezione.

Quali benchmark di sicurezza sono peggiorati

OpenAI segnala regressi statisticamente significativi nel punteggio di completamento sicuro — una metrica in cui valori più alti sono migliori — per GPT-6 Sol nell’autolesionismo standard e per GPT-6 Luna nell’autolesionismo standard, nella violenza grafica e nei contenuti sessuali. La tabella riporta i punteggi delle coppie di modelli indicate nella system card.

CategoriaModello di riferimento (agosto)PunteggioModello di ottobrePunteggio
Autolesionismo standardGPT-5.6 Sol (August)0.934GPT-6 Sol (October)0.896
Autolesionismo standardGPT-5.6 Luna (August)0.932GPT-6 Luna (October)0.901
Violenza graficaGPT-5.6 Luna (August)0.867GPT-6 Luna (October)0.812
Contenuti sessualiGPT-5.6 Luna (August)0.971GPT-6 Luna (October)0.899

Nelle valutazioni per utenti under 18, entrambi i modelli hanno registrato regressi significativi rispetto ai rispettivi GPT-5.6 di agosto nelle categorie dei contenuti soggetti a limiti d’età, dei contenuti sessuali e della dipendenza emotiva; per GPT-6 Luna il calo significativo riguarda anche la violenza grafica. Per la dipendenza emotiva, il punteggio è passato da 0.921 a 0.770 per GPT-6 Sol e da 0.927 a 0.734 per GPT-6 Luna.

Che cosa dicono i punteggi sull’uso quotidiano

OpenAI afferma che i prompt più impegnativi delle sue valutazioni non rappresentano il traffico medio di produzione. Alcuni test, inoltre, non comprendono gli interventi a livello di sistema: i risultati dei benchmark non sono quindi stime della frequenza con cui si verificano risposte dannose nell’uso ordinario.

Per le valutazioni U18, OpenAI descrive un blocco aggiuntivo basato su classificatori per alcune risposte legate all’autolesionismo, ai contenuti sessuali e alla violenza grafica. Questo intervento non è incluso nei punteggi grezzi dei test U18.

Le classificazioni di capacità di OpenAI

OpenAI colloca GPT-6 Sol e GPT-6 Luna nella fascia High per le capacità di cybersicurezza e nei domini biologico e chimico. In cybersicurezza entrambi restano al di sotto della soglia Critical; nessuno dei due raggiunge la soglia High per l’auto-miglioramento dell’IA.