Terug naar het woordenboek

Safety filter.

Ingebouwde regels en classifiers in AI-systemen die schadelijke output (CSAM, suïcide-instructies, wapenproductie) proberen te voorkomen, niet onfeilbaar, te omzeilen via jailbreaks.

Categorie
Engelse term
Safety filter (AI)
Bijgewerkt
29 mei 2026
Door Jeremy LomanOprichter CyberBurgerGeen schuld, geen schaamte
Definitie

Korte definitie.

Ingebouwde regels en classifiers in AI-systemen die schadelijke output (CSAM, suïcide-instructies, wapenproductie) proberen te voorkomen, niet onfeilbaar, te omzeilen via jailbreaks.

Achtergrond

Uitgebreide uitleg.

Safety filters werken op meerdere lagen: pre-prompt (verzoek herkennen als ongepast), in-generation (output monitoren tijdens generatie), post-generation (output checken voor verzending). Geen enkele laag is 100% effectief. Belangrijkste implementaties zijn moderatie-API’s van OpenAI, Google, Meta en Anthropic. Voor kinderbescherming relevant: alignment richt zich op CSAM-generatie, grooming-gedrag, suïcide-bevordering. Onder EU AI Act art. 50 verplicht voor bepaalde toepassingen.

Handelingsperspectief

Voor de professional.

Voor IT-inkoop: vraag bij AI-leveranciers naar safety-filter-architectuur. Voor jeugdzorg en school: weet dat safety filters jailbreak-bestendig moeten zijn. Voor beleidsmakers: ondersteun onafhankelijke red-teaming.

In de woorden van een vriend

Voor de jongere.

Voor de jongere

AI-makers proberen schadelijke output te blokkeren, maar mensen vinden steeds nieuwe omwegen, verlaat geen kritieke beslissingen aan AI alleen.

Hulp halen

Hulplijn & meldpunt.

Niemand hoeft hier alleen mee om te gaan. Deze hulplijnen zijn gratis en bereikbaar, vandaag.

Verder lezen

Gerelateerde termen.