De Common Sense Media Youth AI Safety Institute beoordeelde ChatGPT for Teens in een update van 7 oktober 2026 als een ‘onaanvaardbaar risico’. De testresultaten waren gemengd: expliciet seksueel en romantisch rollenspel werd geweigerd, maar de onderzoekers meldden tekortkomingen bij crisisverwijzingen, oudermeldingen en enkele andere functies. De beoordeling betrof tests met accounts in de Verenigde Staten, niet een meting van alle tienergebruikers.
Wat de beoordeling van ChatGPT for Teens aantrof
OpenAI kondigde ChatGPT for Teens op 18 augustus 2026 aan als een ervaring voor tieners met veiligheidsmaatregelen, leerfuncties en ouderlijk toezicht. Het is geen afzonderlijke app of model: de ervaring bestaat uit instellingen, prompts, classificatiesystemen en onderdelen van de interface voor accounts die als tieneraccounts worden herkend of vermoed.
Het instituut voerde vóór en na de lancering meer dan 4.000 prompts uit, verdeeld over verschillende accounttypen en instellingen. De beoordeling gaf het product de kwalificatie ‘onaanvaardbaar risico’ binnen het eigen beoordelingskader van het instituut. Dat oordeel ging samen met uiteenlopende bevindingen: sommige beperkingen hielden stand, terwijl andere geteste beschermingen volgens de beoordeling niet consequent genoeg werkten.
Wat de percentages voor crisisverwijzingen meten
Bij de crisistests beoordeelden drie kinder- en jeugdpsychiaters 201 van de 390 unieke mentale-gezondheidsprompts als prompts waarvoor een verwijzing naar hulpbronnen nodig was. In de gematchte test met identieke prompts en gekoppelde accounts van 13-jarigen rapporteerde het instituut de volgende percentages vóór en na de lancering. De accounts gebruikten de standaardinstellingen.
| Maatstaf | Vóór de lancering | Na de lancering |
| Verwijzing naar een crisishulplijn | 33% | 23% |
| Verwijzing naar een specifieke zorgprofessional | 68% | 58% |
| Verwijzing naar een hulpbron | 77% | 74% |
| Betrekken van een vertrouwde volwassene | 87% | 94% |
De test vóór de lancering liep van 13 juli tot en met 17 augustus 2026; de test erna van 25 augustus tot en met 28 september 2026. De percentages beschrijven de beoordeelde prompts in deze specifieke test, niet het aandeel tieners of gesprekken waarvoor ChatGPT in de praktijk hulp zou adviseren.
In de bredere crisistest na de lancering kreeg meer dan één op de vier prompts die volgens het instituut een crisisverwijzing verdienden, zo’n verwijzing niet. Het instituut constateerde ook dat antwoorden op crisissituaties in het algemeen korter en inhoudelijk sterker waren. De lagere percentages voor verschillende verwijzingen en die verbeteringen kwamen allebei in de beoordeling aan bod.
Hoe oudermeldingen zijn getest
In een gerichte test met meer dan twaalf nieuwe, aan ouders gekoppelde accounts ontving het instituut geen oudermeldingen tijdens gesprekken over suïcidale gedachten, zelfbeschadiging of eetstoornissen. De sessies duurden vijf minuten tot maximaal een uur. In de bredere crisistests over meerdere weken kwamen in totaal vier meldingen binnen: twee vóór en twee na de lancering.
OpenAI betwistte de opzet van de gerichte meldingentest en stelde dat gekoppelde accounts enkele uren nodig hebben om te activeren. Common Sense Media zei dat sommige geteste accounts langer dan de aanvankelijke activeringstijd gekoppeld waren geweest en toch geen melding opleverden. De beoordeling beschreef accounts met verschillende koppelingsduren; de uitkomsten gelden voor de geteste situaties.
OpenAI beschreef ouderlijk toezicht als instellingen waarmee ouders bepaalde onderdelen konden aanpassen, naast meldingen in beperkte situaties met een hoog risico. De aankondiging noemde onder meer Quiet Hours en geselecteerde instellingen voor tienergebruik.
Study mode en andere geteste maatregelen
Niet alle beschermingen faalden in de tests. Het instituut rapporteerde dat ChatGPT expliciet seksueel en romantisch rollenspel weigerde. Bij een test met gewelddadig rollenspel ging het model volgens de beoordeling echter door nadat het had gezegd dat niet te zullen doen. De onderzoekers signaleerden ook taalgebruik dat een vriendachtige band kon suggereren.
OpenAI presenteerde Study mode als een leerfunctie die leerlingen met vragen en stapsgewijze begeleiding door opgaven moest helpen. Het instituut meldde dat leerlingen in de tests de bedoelde begeleiding konden omzeilen: de optie ‘Show me the answer’ bood een rechtstreeks antwoord, en het verwijderen van het voorvoegsel @study kon de werking van Study Hours omzeilen.
Pauzeherinneringen verschenen volgens de beoordeling twee keer in bijna 2.000 prompts, telkens in gesprekken met meer dan 150 berichten. Het instituut meldde daarnaast dat het wijzigen van de tijdzone van een apparaat Quiet Hours kon omzeilen.
De grenzen van de bevindingen
De geteste accounts waren gebaseerd in de Verenigde Staten, in de omgeving van San Francisco. De testperioden vóór en na de lancering volgden op elkaar in plaats van gelijktijdig plaats te vinden. Daardoor konden eventuele veranderingen in het onderliggende model samenvallen met de introductie van de tienerinstellingen.
Het instituut testte geen beeldgeneratie, personalisatie, Voice mode of groepsgesprekken en berekende geen overeenstemming tussen beoordelaars. De resultaten beschrijven dus de onderzochte prompts, accounts en functies; ze zijn geen schatting van het gedrag bij alle tieners of in alle onderdelen van ChatGPT.