Verborgen Watermerken in AI Veranderen Hoe Chatbots Werken
Onderzoekers ontdekten dat onzichtbare watermerken in AI-chatbots — bedoeld om te bewijzen wie ze maakte — eigenlijk veranderen hoe deze tools functioneren. De veranderingen kunnen ze minder betrouwbaar en makkelijker voor te liegen maken.
AI-bedrijven voegen onzichtbare watermerken toe aan hun chatbots. Stel je het voor als een verborgen digitale handtekening die bewijst van welk bedrijf de AI afkomstig is. Het doel is voorkomen dat mensen claimen dat zij de AI zelf hebben gebouwd.
Maar onderzoekers van Lasso Security ontdekten iets onverwachts: deze watermerken beïnvloeden eigenlijk hoe de AI zich gedraagt. Toen zij zes verschillende AI-modellen testten met een watermerksysteem genaamd SynthID-Text, vonden zij echte problemen.
De watermerken maakten de AI minder nauwkeurig wanneer deze hulptools gebruikt (zoals informatie opzoeken of berekeningen uitvoeren). Nog erger: ze maakten de AI makkelijker te manipuleren. Normaal gesproken zijn AI-systemen ontworpen om schadelijke verzoeken te weigeren. Maar met watermerken erin konden hackers de AI gemakkelijker misleiden om die veiligheidsmechanismes te negeren via een zogenaamde "prompt injection attack" — eigenlijk gewoon slim geformuleerde instructies die de originele beveiligingen van de AI omzeilen.
Het opmerkelijke is dat de watermerken op sommige AI-modellen meer gedragsveranderingen veroorzaakten dan simpelweg aanpassen hoe "creatief" of "streng" de AI ingesteld is. Dit roept een belangrijke vraag op: is het voordeel van bewijzen wie de AI maakte wel de kosten waard als het systeem daardoor minder veilig en betrouwbaar wordt?
Originele bron: Lasso.security
