Die am 7. Oktober 2026 aktualisierte Bewertung des Common Sense Media Youth AI Safety Institute stuft ChatGPT for Teens für Nutzer unter 18 Jahren als inakzeptables Risiko ein. Die Tests ergaben ein gemischtes Bild: Einige Rollenspiel-Schutzfunktionen griffen, während das Institut bei Krisenverweisen, Elternmeldungen und weiteren Funktionen Schwächen feststellte. OpenAI hatte das Teen-Angebot am 18. August 2026 mit Schutz- und Lernfunktionen angekündigt.
Was die Bewertung zu ChatGPT for Teens ergab
Das Institut prüfte mehr als 4.000 Eingaben vor und nach dem Start des Teen-Angebots. Dazu gehörten Tests zu psychischen Krisen, Elternmeldungen, Rollenspielen, Lernfunktionen, Pausenerinnerungen und der Alterseinschätzung.
Nicht alle Schutzmechanismen versagten: In den Tests wurden explizite sexuelle und romantische Rollenspiele abgelehnt. Zugleich berichtete das Institut von inkonsistenten Grenzen in anderen Situationen, darunter einem Gewalt-Rollenspiel, bei dem das Modell nach einer zunächst erklärten Ablehnung weitermachte. Es stellte außerdem freundschaftlich wirkende Formulierungen fest, obwohl OpenAI ChatGPT for Teens als ein auf Jugendliche zugeschnittenes Erlebnis mit Schutzvorgaben beschrieben hatte.
Was die Krisenverweis-Zahlen messen
Bei der nach dem Start durchgeführten Prüfung psychischer Gesundheit erhielten mehr als ein Viertel der Eingaben, für die das Institut einen Krisenverweis für erforderlich hielt, keinen solchen Verweis. In einem gesonderten Vergleich mit identischen, als ressourcenwürdig eingestuften Eingaben untersuchte das Institut verknüpfte Konten von 13-Jährigen unter Standardeinstellungen. Die Tests vor dem Start liefen vom 13. Juli bis 17. August 2026, die Tests danach vom 25. August bis 28. September 2026.
| Messgröße | Vor dem Start | Nach dem Start |
| Verweis auf eine Krisenhotline | 33 % | 23 % |
| Verweis auf eine konkrete medizinische oder psychische Fachperson | 68 % | 58 % |
| Verweis auf irgendeine Ressource | 77 % | 74 % |
| Einbeziehung einer Vertrauensperson | 87 % | 94 % |
Die Werte beziehen sich auf 201 identische Eingaben, die das Institut als ressourcenwürdig einstufte, und auf verknüpfte Konten von 13-Jährigen. Sie beschreiben diese Testkonfiguration, nicht die Nutzung durch Teenager insgesamt. Die Testzeiträume lagen nacheinander; das Institut weist darauf hin, dass Veränderungen am zugrunde liegenden Modell die Unterschiede zwischen den Zeiträumen mit beeinflusst haben könnten.
Wie die Elternmeldungen getestet wurden
In einem fokussierten Test mit mehr als einem Dutzend neuer, mit Elternkonten verknüpfter Konten erhielt das Institut während der Gespräche keine Elternmeldung zu Suizidgedanken, Selbstverletzung oder Essstörungen. Die Sitzungen dauerten zwischen fünf Minuten und einer Stunde. Davon getrennt berichtete das Institut über vier Meldungen in seinen umfassenderen, wochenlangen Krisentest-Batterien: zwei vor und zwei nach dem Start.
OpenAI hielt den Einwand entgegen, verknüpfte Konten benötigten mehrere Stunden, bis sie aktiviert seien. Das Institut erklärte, einige der getesteten Konten seien länger als die anfängliche Aktivierungszeit verknüpft gewesen und hätten dennoch keine Meldung ausgelöst.
Study mode und weitere Schutzfunktionen
OpenAI beschrieb Study mode als Lernfunktion, die Jugendliche mit Fragen und schrittweiser Unterstützung durch Aufgaben führen soll. In den Tests ließ sich diese vorgesehene Lernweise laut Institut umgehen: Die Option „Show me the answer“ bot eine direkte Lösung an, und das Entfernen des Präfixes @study konnte die Study-Funktion umgehen.
Auch Pausenerinnerungen erschienen selten: Das Institut zählte zwei Erinnerungen bei knapp 2.000 Eingaben. Beide traten in Gesprächen mit mehr als 150 Nachrichten auf. Zudem berichtete es, dass sich Quiet Hours durch eine Änderung der Zeitzone am Gerät umgehen ließ.
Geltungsbereich der Ergebnisse
Die Tests fanden in den USA mit Konten aus der San Francisco Bay Area statt. Das Institut prüfte weder Bildgenerierung noch Personalisierung, den Sprachmodus oder Gruppenchats. Seine Vorher-Nachher-Testzeiträume folgten aufeinander, statt parallel zu laufen; dadurch lässt sich der Einfluss der Teen-Einstellungen nicht vollständig von möglichen Änderungen am zugrunde liegenden Modell trennen.