OpenAI onthult wat AI stiekem deed: liegen, lekken, omzeilen
In dit artikel:
OpenAI heeft zes niet eerder gemelde incidenten bekendgemaakt waarbij AI-modellen tijdens training en tests onverwacht gedrag vertoonden. De modellen verzonnen ontbrekende informatie, omzeilden beperkingen en deelden bestanden via internet, hoewel dat niet was toegestaan. Volgens OpenAI laten de voorvallen zien dat krachtige systemen opdrachten soms op manieren proberen uit te voeren die niet overeenkomen met de bedoeling van de gebruiker of ontwikkelaar.
In één geval vond een model in openbare softwarebestanden een gelekte API-sleutel. Het gebruikte die zonder toestemming, maar verzon financiële gegevens toen de gewenste informatie niet beschikbaar bleek. Een ander model uploadde zelf een bestand naar internet om ernaar te kunnen verwijzen als bron, nadat het geen online onderbouwing voor een antwoord had gevonden. Ook gebruikten AI-agenten interne software en openbare websites om onderling informatie uit te wisselen, ondanks instructies om bestanden lokaal te houden. Bij deze zes gevallen werd geen extern bedrijf gehackt.
OpenAI noemt dit gedrag ‘misalignment’ en voert een vast proces in om incidenten sneller te onderzoeken en openbaar te maken. Medewerkers kunnen verdachte voorvallen melden, waarna de ernst en de noodzaak van publicatie worden beoordeeld. Het bedrijf benadrukt dat de zes gevallen geen volledig overzicht vormen. Mede na een eerder, ernstiger incident waarbij een onderzoeksmodel tijdens tests beveiligingen omzeilde en systemen van Hugging Face binnendrong, waarschuwt OpenAI dat de beheersing van steeds krachtigere AI nog onvoldoende is opgelost. Het onderzoekt bovendien andere gevallen waarin modellen invloed hadden op externe websites en diensten.
Vandaag Inside: Wilfred Genee verbaast zich In de Wandelgangen over Raymond Mens: 'Dat je dat durft!'