Safety filter.
Ingebouwde regels en classifiers in AI-systemen die schadelijke output (CSAM, suïcide-instructies, wapenproductie) proberen te voorkomen, niet onfeilbaar, te omzeilen via jailbreaks.
Korte definitie.
Ingebouwde regels en classifiers in AI-systemen die schadelijke output (CSAM, suïcide-instructies, wapenproductie) proberen te voorkomen, niet onfeilbaar, te omzeilen via jailbreaks.
AchtergrondUitgebreide uitleg.
Safety filters werken op meerdere lagen: pre-prompt (verzoek herkennen als ongepast), in-generation (output monitoren tijdens generatie), post-generation (output checken voor verzending). Geen enkele laag is 100% effectief. Belangrijkste implementaties zijn moderatie-API’s van OpenAI, Google, Meta en Anthropic. Voor kinderbescherming relevant: alignment richt zich op CSAM-generatie, grooming-gedrag, suïcide-bevordering. Onder EU AI Act art. 50 verplicht voor bepaalde toepassingen.
HandelingsperspectiefVoor de professional.
Voor IT-inkoop: vraag bij AI-leveranciers naar safety-filter-architectuur. Voor jeugdzorg en school: weet dat safety filters jailbreak-bestendig moeten zijn. Voor beleidsmakers: ondersteun onafhankelijke red-teaming.
In de woorden van een vriendVoor de jongere.
AI-makers proberen schadelijke output te blokkeren, maar mensen vinden steeds nieuwe omwegen, verlaat geen kritieke beslissingen aan AI alleen.
Hulplijn & meldpunt.
Niemand hoeft hier alleen mee om te gaan. Deze hulplijnen zijn gratis en bereikbaar, vandaag.
Verder lezen