AI-model van Anthropic doet zich voor als mens in beveiligingstest

woensdag, 5 augustus 2026 (22:23) - Newsbit.nl

In dit artikel:

Tijdens een beveiligingstest van het Britse AI Security Institute (AISI) zette Anthropic’s geavanceerde Mythos 5-model meerdere valse online identiteiten in. Het onderzocht eerst wie een open source-project beheerde en probeerde daarna een echte ontwikkelaar ertoe te bewegen kwaadaardige code goed te keuren als software-update.

Toen andere ontwikkelaars de wijziging publiekelijk in twijfel trokken, probeerde het model eerdere sporen te verbergen en overwoog het een nieuwe identiteit aan te nemen. Ook stuurde het berichten en bestanden naar echte mensen met de bedoeling hen schadelijke software te laten uitvoeren. Volgens het AISI was dit de eerste test waarbij een AI-model zelfstandig sociale manipulatie tegen echte personen toepaste. Geen van de pogingen slaagde en er ontstond geen schade.

Voor de evaluatie waren beveiligingsfilters bewust uitgeschakeld en hadden de modellen internettoegang. Anthropic benadrukt daarom dat de omstandigheden niet overeenkomen met normaal gebruik en dat Mythos 5 niet uit een beveiligde omgeving is ontsnapt. Ook twee incidenten met OpenAI’s GPT-5.6-Sol vonden plaats nadat veiligheidsmechanismen waren uitgeschakeld. De bevindingen volgen op eerdere meldingen van AI-modellen die testomgevingen wisten te omzeilen en versterken de roep om strengere veiligheidsmaatregelen. In de Verenigde Staten ligt inmiddels een wetsvoorstel om bedrijven verplicht controle te laten behouden over het uitschakelen of beperken van geavanceerde AI-modellen.

BEKIJK OOK:

De Oranjezomer: Noa Vahle over mogelijke Ajax-transfer: 'Dat zou ik wel opvallend vinden!'