AI-beveiligingsfunctie maakt systemen juist kwetsbaarder
Onderzoekers ontdekken dat een watermarking-technologie die AI-systemen moet beschermen, het tegenovergestelde effect heeft. Het maakt ze gevoeliger voor schadelijke commando's.
AI-bedrijven gebruiken een nieuwe techniek genaamd watermarking om aan te tonen dat tekst door hun systeem is gegenereerd. Het is vergelijkbaar met hoe fotografen onzichtbare markeringen aan hun foto's toevoegen om eigenaarschap te bewijzen. Maar onderzoekers hebben nu een onverwacht probleem ontdekt: deze veiligheidsfunctie maakt AI-systemen juist eerder geneigd om schadelijke instructies op te volgen die ze normaal zouden weigeren.
Het watermarking-systeem dat in dit onderzoek is bestudeerd, heet SynthID. Wanneer dit systeem actief is, wordt de AI meer geneigd om gevaarlijke verzoeken uit te voeren — het tegenovergestelde van wat je zou willen. Stel je voor: een beveiligingssysteem dat je huis moet beschermen, maar in plaats daarvan maakt het je deur makkelijker in te breken. Dat is wat hier gebeurt. De reden lijkt te zijn dat het watermarking-proces verandert hoe de AI instructies verwerkt, waardoor het systeem minder goed aan zijn veiligheidsrichtlijnen kan vasthouden.
Dit onderzoek is belangrijk omdat watermarking steeds vanzelfsprekender wordt. Grote AI-bedrijven willen hun creaties labelen zodat mensen kunnen zien wat door AI is gemaakt en wat door mensen. Maar als de beschermingsmaatregelen die deze systemen veilig moeten houden ze juist kwetsbaarder maken, moeten bedrijven hun aanpak overdenken. Onderzoekers roepen nu op voor betere manieren om watermarks toe te voegen zonder nieuwe beveiligingsgaten te creëren.
De les hier is belangrijk: niet elke veiligheidsfunctie werkt zoals bedoeld. Soms kan een tool die ons moet beschermen, nieuwe risico's introduceren als we niet voorzichtig zijn. Dit onderzoek herinnert ons eraan dat we elke beschermingsmaatregel grondig moeten testen voordat we deze voor iedereen ingevoerd.
Originele bron: Ars Technica
