Jailbreak (LLM).
Technieken waarmee een gebruiker een AI-chatbot dwingt om zijn ingebouwde veiligheidsfilters te omzeilen, en zo verboden of schadelijke output produceert.
Korte definitie.
Technieken waarmee een gebruiker een AI-chatbot dwingt om zijn ingebouwde veiligheidsfilters te omzeilen, en zo verboden of schadelijke output produceert.
AchtergrondUitgebreide uitleg.
Jailbreaking begon met “DAN” (Do Anything Now)-prompts en is uitgegroeid tot een gemeenschap die continue nieuwe methoden ontwikkelt. Voor minderjarigen is dit risicovol omdat jailbroken AI’s seksueel, gewelddadig of schadelijk advies kunnen geven (drugsproductie, suïcide-methoden, manipulatie). OpenAI, Anthropic en andere providers werken continu aan hardening, maar het is een arms race. Onder EU AI Act vallen verplichtingen voor robuuste safety filters.
HandelingsperspectiefVoor de professional.
Voor scholen die LLM’s inzetten: weet dat leerlingen jailbreaking proberen; werk niet met ongesegregeerde algemene chatbots maar met afgeschermde varianten. Voor mediawijsheid: leer het mechanisme als kritische vaardigheid, niet als hack-handleiding.
In de woorden van een vriendVoor de jongere.
Een AI laten zeggen wat het normaal niet zou zeggen voelt slim, maar de output kan schade aanrichten of gevaarlijk advies geven, gebruik AI binnen kaders.
Hulplijn & meldpunt.
Niemand hoeft hier alleen mee om te gaan. Deze hulplijnen zijn gratis en bereikbaar, vandaag.
Verder lezen