1. Een nieuwe aanvalstechniek, PuzzleMask genaamd, maakt het mogelijk om schadelijke commando's te verbergen in normale Engelse tekst. Deze techniek maakt geen gebruik van speciale symbolen, verborgen tekst of gecodeerde reeksen.
2. PuzzleMask exploiteert het verschil in interpretatie tussen verschillende AI-modellen voor dezelfde tekst, met name het onderscheid tussen een snel screeningsmodel en een capabeler, later AI-systeem.
3. Het risico ontstaat omdat organisaties AI-assistenten toegang verlenen tot potentieel gevoelige informatie en functionaliteiten zoals bestanden, code-interpreters, bedrijfsgegevens en actieondernemende tools.
4. Het proces werkt doordat een eerste, sneller screeningsmodel een passage als ongevaarlijk kan bestempelen, mogelijk door beperkte verwerkingscapaciteit.
5. Het daaropvolgende, meer geavanceerde AI-model, dat meer tijd en middelen heeft voor analyse, kan de verborgen instructie wel herkennen en hiernaar handelen.
6. De techniek verpakt een beleid-schendende payload in tekst die voor menselijke lezers en lichtgewicht controlemechanismen normaal lijkt.
7. De methode is niet afhankelijk van gangbare camouflage-technieken zoals Base64-codering, emoji-reeksen, onzichtbare tekens of duidelijke opmaaktrucs, waardoor traditionele patroon-gebaseerde detectiemethoden minder effectief zijn.
8. Onderzoekers van Check Point identificeerden dit probleem tijdens tests naar de verwerking van zorgvuldig opgestelde teksten door snelle beleidscontroles.
9. In uitgevoerde tests met 23 opgestelde prompts classificeerden de screeningsmodellen de "wrappers" in alle gevallen als veilig.
10. Echter, bij doeltests met 18 prompts slaagde een model met hoge redeneercapaciteit erin de verborgen instructie in 17 gevallen (94,4%) te herstellen en hiernaar te handelen.
11. De experimenten werden uitgevoerd in gecontroleerde, gesimuleerde omgevingen en hadden geen toegang tot of schade toegebracht aan echte bestanden.
12. Het onderzoek toont aan dat een front-end filter de verborgen prompt mogelijk niet herkent, waardoor de verantwoordelijkheid voor detectie bij de downstream AI-controles komt te liggen.
13. Dit is met name risicovol wanneer een AI-agent bevoorrechte tools of gevoelige gegevens tot zijn beschikking heeft.
14. Het probleem ontstaat door een verschil in capaciteit en optimalisatie: een snelle poortwachter is geoptimaliseerd voor snelheid, terwijl een doelmodel meer tijd heeft voor redenering en mogelijk toegang heeft tot een code-interpreter.
15. Het doelmodel kan de verborgen structuur identificeren, de payload extraheren en deze vervolgens behandelen als nieuwe, uitvoerbare invoer.
16. Rapporten over commando's die verborgen zijn in e-mails illustreren het bredere gevaar: een normaal ogend bericht kan een instructie worden als het systeem geen onderscheid kan maken tussen data en commando's.
17. Dit onderscheid is belangrijk voor teams die AI-agenten inzetten die onvertrouwd materiaal verwerken.
18. Een mogelijke beveiligingsmaatregel is om onvertrouwde inhoud te parafraseren voordat deze de volgende verwerkingsfase bereikt.
19. Het herschrijven van tekst in een andere formulering verwijdert doorgaans de specifieke structuur die de verborgen payload draagt, hoewel dit extra verwerkingskosten met zich meebrengt en de precisie van de oorspronkelijke invoer kan beïnvloeden.
20. Organisaties kunnen ook hun poortwachterregels versterken om verdachte, zelfreferentiële bewoordingen te markeren, in plaats van uitsluitend te focussen op bekende schadelijke zinnen.
21. In de tests kon een specifieke aanpassing van de regels, gericht op kwantitatieve en zelfreferentiële zinsneden, een poortwachter in staat stellen alle 23 opgestelde prompts te detecteren, al kunnen strengere regels leiden tot meer valse positieven.
22. Inputfiltering alleen is niet voldoende om dit risico te mitigeren.
23. Veiligheidsteams moeten daarom ook de uitvoer van modellen, toolaanroepen en acties monitoren.
24. Goedkeuring is vereist voor taken met grote impact, zoals het wijzigen van bestanden, het verzenden van gegevens of het uitvoeren van commando's.
25. Dit komt overeen met de OWASP GenAI Top 10 richtlijnen, die benadrukken dat het gezag van een AI-agent beperkt moet worden.
26. Ontwikkelaars wordt aangeraden om webteksten, e-mails, documenten, issue-commentaren en logs te behandelen als onvertrouwd wanneer een AI-agent deze verwerkt.
27. Onderzoek naar aanvallen via GitHub-commentaren toont aan hoe externe inhoud ontwikkelingsworkflows kan bereiken en geautomatiseerde tools kan beïnvloeden.
28. PuzzleMask benadrukt een bredere les voor AI-beveiliging: natuurlijke taal kan effectief dienen als een leveringsmechanisme voor commando's.
29. Verdedigers dienen zich te richten op wat een AI uiteindelijk uitvoert, en niet alleen op de ogenschijnlijke verdachtheid van de invoer.
30. Het scheiden van inhoud van instructies, het verminderen van toegekende machtigingen en het controleren van gevoelige acties zijn cruciaal om de schade te beperken wanneer een initiële controle een verborgen commando mist. Deze maatregelen versnellen ook het herstel na een mogelijke compromittering.
31. PuzzleMask wordt niet beschouwd als een jailbreak op zichzelf, maar als een methode om een niet-gecontroleerde instructie voor een doelmodel te verkrijgen, wat specifieke risico's met zich meebrengt, zoals AI-workflow-identiteitsaanvallen.
32. De techniek is gericht op toepassingen die een snel screeningsmodel gebruiken voordat een capabeler AI-systeem de invoer verwerkt.
33. Het belang van deze bevinding ligt in het feit dat AI-systemen steeds vaker toegang krijgen tot actiekrachtige mogelijkheden.
Popup content goes here.
Met een account heeft u de mogelijkheid om het gehele nieuwsoverzicht te bekijken en op ieder artikel een reactie-icoon te geven.
Met Newsfacts.info kunt u op de hoogte blijven van de laatste ontwikkelingen, zonder veel tijd te besteden aan het volgen van het nieuws. Ontdek vandaag nog de voordelen van Newsfacts.info!