Josh Engels maakte op 12 september 2026 bekend dat hij het AGI-veiligheidsteam van Google DeepMind drie weken eerder had verlaten en naar METR was gegaan. Bij die organisatie wil de AI-veiligheidsonderzoeker misalignment onderzoeken en nagaan of veiligheidsmaatregelen en alignment-onderzoek gelijke tred houden met de ontwikkeling van steeds krachtigere AI-systemen.
Engels waarschuwt dat AI-systemen binnen vijf jaar enorme schade kunnen veroorzaken. Hij noemt geen exacte kans; het gaat om zijn persoonlijke risico-inschatting.
Van Google DeepMind naar METR
Engels zei dat hij zijn werk bij Google DeepMind waardeerde en aanbiedingen van Anthropic en OpenAI had afgeslagen. Hij koppelde zijn vertrek aan de hoge inzet rond geavanceerde AI: volgens hem kunnen de mogelijkheden van frontier-AI sneller groeien dan onderzoekers systemen kunnen afstemmen en evalueren.
METR staat voor Model Evaluation and Threat Research. Engels beschrijft zijn nieuwe werk als onderzoek naar AI-misalignment-incidenten. Zijn agenda bestaat uit drie onderdelen: nagaan waar misalignment tijdens de training ontstaat, beoordelen of bestaande maatregelen voldoende zijn en onderzoeken of het alignment-onderzoek op koers ligt om het probleem op te lossen.
Waarom Engels zich zorgen maakt over alignment
Met alignment wordt bedoeld dat het gedrag van een AI-systeem overeenkomt met menselijke doelen en veiligheidsgrenzen. Engels waarschuwt dat die afstemming mogelijk niet snel genoeg verbetert wanneer AI-capaciteiten verder versnellen.
Zijn belangrijkste technische zorg is recursieve zelfverbetering: een scenario waarin AI-systemen helpen om krachtigere opvolgers te maken. Daardoor kan een feedbacklus ontstaan waarin nieuwe systemen bijdragen aan de ontwikkeling van nog capabelere systemen. Engels zegt dat onderzoekers momenteel niet weten hoe ze AI veilig genoeg kunnen maken voor zo’n proces.
Dat is een risicoanalyse, geen bewering dat publieke AI-systemen dit proces al uitvoeren. De kern van zijn bezwaar is juist dat de veiligheidsmethoden volgens hem achter kunnen raken op de capaciteitsgroei voordat zo’n ontwikkeling verantwoord kan worden beoordeeld.
Wat Engels bij METR wil onderzoeken
Engels wil bij METR niet alleen kijken naar wat een model kan, maar ook naar de manier waarop ongewenst gedrag ontstaat en hoe betrouwbaar bestaande beschermingsmaatregelen zijn. Zijn aangekondigde onderzoek richt zich op:
- de oorsprong van misalignment tijdens de training;
- de vraag of huidige mitigaties voldoende zijn;
- de voortgang van alignment-onderzoek;
Die onderzoeksagenda sluit aan bij zijn oproep om AI-ontwikkeling te vertragen wanneer capaciteiten sneller groeien dan het vermogen om modellen af te stemmen en hun gedrag daadwerkelijk te beoordelen.
Wat betekent de waarschuwing over vijf jaar?
Engels zei dat hij een “angstaanjagende kans” ziet dat AI-systemen binnen vijf jaar immense schade veroorzaken. Hij gaf daarbij geen exacte waarschijnlijkheid. Zijn uitspraak moet daarom worden gelezen als een persoonlijke inschatting van het risico en de urgentie, niet als een voorspelling dat een catastrofe zeker zal plaatsvinden.