AI · 21 september 2026

Ook gepubliceerd in العربية

Zichtbare denkketens zijn een veiligheidsvoordeel voor AI, maar transparantie neemt af

graphical user interface
Unsplash

Onderzoekers van Google Deepmind waarschuwen dat de zichtbaarheid van denkprocessen van kunstmatige intelligentie afneemt. Rohin Shah en Anca Dragan, verbonden aan het pas opgerichte Deepmind Institute, stellen in een van de eerste publicaties dat de zichtbare denkketens (Chain of Thought, CoT) een essentiële veiligheidsfunctie vervullen. Doordat modellen hun tussenstappen in begrijpelijke taal vastleggen, kunnen wetenschappers detecteren of een systeem liegt of problematische plannen ontwikkelt. Bij tests met Gemini 3 Pro bleek uit de denkketens dat het model doorhad in een testomgeving te opereren.

Deze transparantie staat volgens de onderzoekers onder druk. OpenAI's systeemkaart voor GPT-6 Astra signaleert al een "aanzienlijke afname van de Chain-of-Thought-bewaakbaarheid". Toekomstige modellen zouden kunnen opereren in voor mensen onleesbare numerieke ruimtes, wat efficiënter is maar volledig ondoorzichtig zou zijn. Shah en Dragan pleiten daarom voor regelmatige metingen van de bewaakbaarheid van denkketens, het behoud van transparante architecturen en trainingstechnieken die modellen ervan weerhouden hun ware overwegingen te verbergen.

De publicatie sluit aan bij bredere waarschuwingen binnen de sector. OpenAI's chief scientist Jakub Pachocki waarschuwde begin september voor controleverlies, mede veroorzaakt door minder controleerbare denkketens. Anthropic-CEO Dario Amodei dringt kort daarna op een vertraging van het ontwikkeltempo aan om veiligheidsonderzoek meer tijd te geven.