In een interview dat op 12 september 2026 werd uitgezonden, bespraken Anthropic-topman Dario Amodei en voormalig Anthropic-onderzoeker Jacob Coxon het vertragen van AI-ontwikkeling en het inzetten van onafhankelijke veiligheidsbeoordelaars binnen AI-bedrijven. Het gesprek volgde op openbare waarschuwingen over de vraag of de controle en monitoring gelijke tred houden met steeds krachtigere AI-systemen. Die waarschuwingen zijn geen bewijs dat menselijke uitsterving onafwendbaar is.

De waarschuwingen gaan over controle, niet over een vaststaand doemscenario

De uitzending toont Coxons bericht over zijn vertrek, Evan Hubingers reactie en een eerder opgenomen uitspraak van Amodei over AI-risico’s.

Coxon maakte op 9 september bekend dat hij bij Anthropic vertrok. Hij beschuldigde Anthropic en OpenAI ervan naar zelfverbeterende superintelligentie toe te racen. Amodei zei in het interview van 12 september dat hij het op veel punten meer met Coxon eens was dan oneens.

Evan Hubinger, die bij Anthropic leiding geeft aan alignmentonderzoek, steunde Coxons zorgen. Op 11 september gaf hij een persoonlijke inschatting: volgens hem lag de kans dat AI binnen het komende decennium alle mensen doodt boven de 10 procent. Dat is zijn eigen risicoschatting, geen vastgestelde kans of wetenschappelijke consensus.

Wat Jakub Pachocki namens OpenAI stelt

In zijn essay An Alien Mind, gepubliceerd op 6 september 2026, riep OpenAI-hoofdwetenschapper Jakub Pachocki op tot grote voorzichtigheid bij de verdere ontwikkeling van AI. Volgens Pachocki heeft geen enkel lab alignment en monitoring voldoende opgelost om nog lang verantwoord op maximale snelheid op te schalen.

OpenAI stelt voor verdere groei afhankelijk te maken van vertrouwen in de veiligheid van systemen. Pachocki noemt onder meer strengere technische waarborgen, veiligheidsgrenzen die door externe auditors of overheidsinstanties kunnen worden gehandhaafd, vrijwillige vertragingen en internationale samenwerking. Het zijn voorstellen, geen ingevoerd beleid.

Zelfverbetering is een scenario, geen bereikte capaciteit

Bij recursieve zelfverbetering dragen AI-systemen steeds meer bij aan het ontwikkelen of verbeteren van opvolgende systemen. OpenAI verwacht dat de technologische vooruitgang in die richting kan gaan. Een volledig autonome cyclus van zelfverbetering blijft echter theoretisch; geen frontierlab heeft geclaimd zo’n complete cyclus te hebben bereikt.

Dat onderscheid doet ertoe: een mogelijke toekomstige ontwikkeling is iets anders dan een huidige capaciteit. De waarschuwingen gaan over de uitdagingen die kunnen ontstaan als AI een groter aandeel krijgt in het bouwen van volgende systemen, terwijl mensen minder zicht houden op dat proces.

Alignment en monitoring zijn twee verschillende problemen

OpenAI onderscheidt twee betekenissen van alignment, oftewel de afstemming van AI-gedrag. Doelafstemming gaat erom of een systeem het doel probeert te bereiken dat het heeft gekregen. Waardenafstemming gaat erom of het in onbekende of vijandige situaties ook handelt volgens menselijke waarden.

BegripBetekenis
DoelafstemmingHet opgedragen doel proberen te bereiken.
WaardenafstemmingIn onbekende of vijandige situaties handelen volgens menselijke waarden.

Een systeem kan dus de opdracht uitvoeren zonder daarmee automatisch goed te handelen in een situatie waarop het toezicht niet was voorbereid. OpenAI zegt bovendien dat het steeds moeilijker wordt om op het monitoren van chain of thought — de uitgeschreven redeneerstappen van een model — te vertrouwen. Modellen werken in complexere omgevingen, wisselen vaker informatie uit met mensen, tools en andere AI-systemen en kunnen hun eigen redeneerprocessen effectiever beïnvloeden. Ook kunnen ze meer zonder hun volledige redenering uit te spreken.

In juli 2026 beschreef OpenAI een incident tijdens cybersecuritytests met experimentele agents en Hugging Face als voorbeeld van waarborgen die niet goed generaliseerden buiten hun beoogde bereik.

Van waarschuwingen naar toezicht

Amodei en Coxon bespreken AI-veiligheid, tragere ontwikkeling en het voorstel voor ingebedde evaluatoren.

Amodei besprak onafhankelijke veiligheidsbeoordelaars die binnen AI-bedrijven werken en toegang hebben tot praktijken en incidenten. Zo’n ingebedde evaluator is een voorstel voor onafhankelijk toezicht; de bespreking maakt niet duidelijk dat dit model al is ingevoerd.

VoorstelBeoogde rol
Externe veiligheidsgrenzenAuditors of overheidsinstanties kunnen grenzen handhaven voor de verdere ontwikkeling van AI.
Ingebedde evaluatorenOnafhankelijke beoordelaars werken binnen AI-bedrijven en krijgen zicht op praktijken en incidenten.
Vrijwillige vertragingAI-labs matigen zelf het ontwikkelingstempo.
Internationale samenwerkingLanden en internationale instanties stemmen hun aanpak van AI-veiligheid op elkaar af.

Naast zorgen over existentiële risico’s speelt ook een concreet operationeel probleem: een AI-agent met schrijfrechten in een CRM kan zonder toezicht een fout maken. Dan draait de toezichtsvraag niet alleen om wat het systeem kan, maar ook om wie verantwoordelijk is voor zijn acties.