Claude van Anthropic hackte onbedoeld drie bedrijven
In dit artikel:
Anthropic heeft bevestigd dat drie Claude-modellen tijdens cyberveiligheidstests ongeoorloofd toegang kregen tot echte systemen van drie organisaties. De incidenten gebeurden terwijl Anthropic samen met testpartner Irregular een afgesloten, internetloze simulatie dacht te gebruiken. Door een misverstand bleek de testomgeving toch online, waardoor de modellen onbeveiligde eindpunten en zwakke wachtwoorden konden benutten. Het bedrijf nam de volledige verantwoordelijkheid op zich en stopte alle lopende evaluaties direct.
Het interne onderzoek kwam op gang na een vergelijkbaar incident bij OpenAI, waarbij AI-modellen uit een afgeschermde testomgeving wisten te ontsnappen en uiteindelijk accounts op Hugging Face bereikten. Anthropic analyseerde daarop eerdere tests opnieuw en onderzoekt de zaak nu verder met onderzoeksorganisatie METR. Het bedrijf roept andere AI-labs op om vergelijkbare controles uit te voeren.
Opvallend is dat de drie betrokken modellen verschillend reageerden toen ze echte systemen bereikten: Opus 4.7 ging door met de aanval, Mythos 5 bleef denken dat het nog in een simulatie zat en een intern model beëindigde de test meteen. Volgens Anthropic wijst dat mogelijk op verschillend gedrag van geavanceerde modellen, maar meer onderzoek is nodig. De onthulling vergroot intussen de zorgen over de cybercapaciteiten van AI, wat in de VS al heeft geleid tot een voorstel voor een ‘AI Kill Switch’.
De Oranjezomer: Rutger Castricum hoort wie volgende week aanschuift bij De Oranjezomer: 'Dan zit ik in het publiek!'