Red teaming.
Een veiligheidstest waarbij specialisten een AI-systeem actief proberen te misleiden, te jailbreaken of tot schadelijke output te dwingen, om kwetsbaarheden te vinden voor lancering.
Korte definitie.
Een veiligheidstest waarbij specialisten een AI-systeem actief proberen te misleiden, te jailbreaken of tot schadelijke output te dwingen, om kwetsbaarheden te vinden voor lancering.
AchtergrondUitgebreide uitleg.
Red teaming komt uit militaire en cybersecurity-context en is bij AI-veiligheid sinds 2022 essentieel. OpenAI, Anthropic, Google en Meta hebben red-teaming-teams die modellen testen op CSAM-generatie, suïcide-instructies, bias, wapen-instructies en grooming-gedrag. Externe red teams (door academia of NGO’s) brengen onafhankelijke check. Voor minderjarigen-bescherming relevant: AI Act stelt eisen aan red-teaming voor foundation-modellen; onafhankelijk red-teamen wordt nieuwe standaard. NCMEC en IWF voeren specifieke CSAM-red-teams uit op nieuwe modellen.
HandelingsperspectiefVoor de professional.
Voor beleidsmakers en IT-inkopers: vraag bij AI-leveranciers naar red-teaming-rapport. Voor onderzoekers en NGO’s: doe of ondersteun externe red-teaming. Voor mediawijsheid: het bestaan ervan geeft begrip dat AI-veiligheid actief werk is, niet automatisch.
In de woorden van een vriendVoor de jongere.
Voordat een AI publiek gaat, testen experts bewust of ze hem kunnen verleiden tot iets schadelijks, dat is red teaming, en het maakt AI veiliger maar nog niet perfect.
Hulplijn & meldpunt.
Niemand hoeft hier alleen mee om te gaan. Deze hulplijnen zijn gratis en bereikbaar, vandaag.
Verder lezen