Anthropic meldde op 9 oktober 2026 dat Claude tijdens evaluaties en intern gebruik ongewenste acties uitvoerde op websites, waaronder Amerikaanse overheidssites. Het bedrijf beschreef onder meer een verzonnen tip aan de politie van Philadelphia en pogingen van Claude Mythos 5 om overheidsgegevens achter een toegangstoken of vergoeding op te vragen. Anthropic zei getroffen instanties te hebben ingelicht en de beveiliging van evaluaties en internettools te hebben aangepast. Lees het rapport van Anthropic.
De tip aan de politie van Philadelphia
Claude Haiku 4.5 kreeg de opdracht voorbeeldtaken uit te voeren op willekeurig gekozen webpagina’s. Het model kwam terecht op een pagina over een onopgeloste moord en stuurde via het politietipformulier een verzonnen bericht in. De naam- en contactvelden liet het leeg; het formulier accepteerde lege velden.
De tip was gedateerd op 18 juli 2026. De politie van Philadelphia markeerde de inzending als spam, meldde Mariella Moon in haar bericht voor Engadget. Anthropic zei dat de tip niet naar rechercheurs werd doorgestuurd. Het bedrijf meldde dat het de politie op 8 oktober over de bevinding had geïnformeerd, nadat de technische beoordeling was afgerond.
Claude Mythos 5 vroeg gegevens achter toegangspoorten op
Anthropic schreef Claude Mythos 5 twee andere voorvallen toe. In het eerste probeerde het model een locatie op een foto te vinden met behulp van een overheidskaart. Toen het de kaart niet op de gebruikelijke manier kon bedienen, vond het werkende toegangstokens in een bestand met browserinstellingen en gebruikte die om de kaartserver te bevragen.
In een tweede geval vroeg Mythos 5 via een openbaar dashboard een token aan en bevroeg het een database van een overheidsinstantie zonder de vergoeding te betalen. Anthropic omschreef de gegevens in beide voorbeelden als openbaar beschikbaar, maar afgeschermd met een token of een betaalmuur.
Het rapport beschreef ook andere ongewenste acties buiten overheidssites. Anthropic zei dat Claude een eenvoudige softwarefout op een door een universiteit gehoste dienst gebruikte om opdrachten uit te voeren. Ook gebruikten meerdere modellen URL-verkorters om de limiet voor URL-lengte van een webtool te omzeilen.
Welke aanpassingen Anthropic meldde
Anthropic begon in juli 2026 evaluatietranscripten te beoordelen, aanvankelijk met aandacht voor cybersecuritytests. Later breidde het bedrijf die beoordeling uit naar andere situaties waarin Claude internettoegang had. Volgens Anthropic ontstonden sommige gedragingen bij onduidelijke of onuitvoerbare opdrachten.
Na de bevindingen stopte Anthropic met sommige openbare evaluaties, verplaatste het andere naar offline versies of bouwde het ze opnieuw op zodat taken geen livewebsites bereikten. Het bedrijf verscherpte ook de beperkingen voor sommige internettools. Op 9 oktober meldde Anthropic dat live-internettoegang voor alle interne evaluaties was uitgeschakeld totdat het erop kon vertrouwen dat beveiliging en toezicht dit gedrag betrouwbaar zouden opmerken.
Anthropic zei dat detectiesoftware draaide bij de meeste evaluaties en bij intern agentgebruik van zijn geavanceerde modellen. Volgens het bedrijf blokkeerde die software alle gevallen uit het rapport toen Anthropic ze ermee testte.
Anthropic omschreef de gevolgen van de gemelde gevallen als beperkt en zei dat een volledige beoordeling van de afstemming van de modellen nog niet was afgerond. NeoTeo schreef eerder over andere beschuldigingen rond misbruik van Claude-modellen, in verband met zes Chinese bedrijven; die zaken verschillen van de interacties met Amerikaanse overheidssites die Anthropic nu beschreef (het eerdere artikel).