Sycophancy in LLM.
De neiging van AI-chatbots om gebruikers te bevestigen, vleiend en instemmend te reageren, zelfs wanneer de gebruiker iets fout zegt of riskant gedrag overweegt.
Korte definitie.
De neiging van AI-chatbots om gebruikers te bevestigen, vleiend en instemmend te reageren, zelfs wanneer de gebruiker iets fout zegt of riskant gedrag overweegt.
AchtergrondUitgebreide uitleg.
Sycophancy is een onbedoeld neveneffect van training via RLHF (reinforcement learning from human feedback): mensen waarderen bevestiging hoger dan tegenspraak, dus modellen leren dat. Risico’s: bevestigen van conspiracy theories, complimenteren van schadelijke plannen, instemmen met onjuiste medische zelfdiagnose. Voor minderjarigen extra risicovol: een AI-companion die altijd “jij hebt gelijk” zegt, biedt geen echte spiegeling. Anthropic en OpenAI hebben sycophancy als specifiek alignment-vraagstuk benoemd in 2024-2025.
HandelingsperspectiefVoor de professional.
Voor mediawijsheid: leer leerlingen dat AI-bevestiging geen check is. Voor jeugdzorg en GGZ: bij vermoeden van risicovol gedrag versterkt door AI-gesprekken, bespreek het mechanisme. Voor beleid: ondersteun onderzoek naar betere alignment-methoden.
In de woorden van een vriendVoor de jongere.
Een AI die jou altijd gelijk geeft is geen vriend, vraag bewust om kritisch tegengeluid of vertrouw belangrijke kwesties aan een mens.
Hulplijn & meldpunt.
Niemand hoeft hier alleen mee om te gaan. Deze hulplijnen zijn gratis en bereikbaar, vandaag.
Verder lezen