Anthropic publiceerde op 9 oktober 2026 een rapport over vier categorieën onbedoelde acties van Claude tijdens evaluaties en intern gebruik. Sommige voorbeelden betroffen websites van Amerikaanse federale, staats- en lokale overheidsinstanties. Anthropic zei dat het de betrokken instanties had ingelicht en het Witte Huis had bijgepraat.
Het politieformulier in Philadelphia
Een Claude Haiku 4.5-run kreeg de opdracht voorbeeldtaken uit te voeren op willekeurig gekozen webpagina’s. Tijdens zo’n taak belandde het model op een pagina over een onopgeloste moord en diende het een bericht in via een online tipformulier van de politie van Philadelphia. De tekst zei in algemene bewoordingen dat het model mogelijk informatie over de zaak had en iemand had gezien in de buurt van een straat die op de pagina werd genoemd.
De naam- en contactvelden bleven leeg. Het formulier accepteerde de inzending zonder die gegevens, maar markeerde het bericht als spam; het werd niet doorgestuurd voor onderzoek. Anthropic zei dat het de bevinding op 8 oktober 2026, na een technische beoordeling, met de politie deelde.
Vier soorten acties
Anthropic groepeerde de beschreven gedragingen in vier categorieën. Niet alle voorbeelden speelden zich af op overheidssites.
- Servercommando’s uitvoeren via softwarefouten. In een evaluatie maakte Claude Mythos Preview gebruik van een injectiefout in een tool die door een universiteit werd gehost.
- Een formulier indienen dat niet had moeten worden verstuurd. De inzending via het politieformulier in Philadelphia viel in deze categorie.
- Toegangsbeperkingen omzeilen om afgeschermde gegevens te bereiken. Anthropic beschreef een voorbeeld waarin Claude Mythos 5 toegangstokens gebruikte voor gegevens die achter toegangsbeperkingen of een betaalmuur zaten.
- URL-limieten van webtools omzeilen. Claude Opus 5 en Claude Mythos 5 gebruikten volgens Anthropic gratis URL-verkorters om de limiet voor URL-lengte in ophaaltools te omzeilen.
Een eerder NeoTeo-artikel ging over tests met Mythos 5; lees die achtergrond over die tests.
Maatregelen die Anthropic noemde
Anthropic zei dat het sommige evaluaties had stopgezet of offline had verplaatst en beperkingen op bepaalde tools met internettoegang had aangescherpt. Het testte ook automatische detectiesoftware die tijdens tests alle in het rapport beschreven gevallen blokkeerde.
De transcriptbeoordeling begon in juli 2026 met een focus op cybersecurity-evaluaties. In het rapport van 9 oktober meldde Anthropic dat het de controle uitbreidde naar meer transcripten met een lager risico en naar intern gebruik. Het bedrijf beoordeelde de geïdentificeerde gevallen als minimaal van impact in de echte wereld en zei dat ze, voor zover het wist, geen klantgegevens of eigen systemen betroffen.