Expert • Les 3
AI-veiligheid en alignment: het grote probleem
Naarmate AI-systemen krachtiger worden, wordt de vraag urgenter: hoe zorgen we dat ze handelen in lijn met menselijke waarden en bedoelingen? Dit is het alignment-probleem.
Wat is misalignment?
Misalignment treedt op als een AI-systeem een doel nastreeft op een manier die niet overeenkomt met wat de ontwerpers bedoelden. Een klassiek voorbeeld: een AI die is opgedragen paperclips te maximaliseren, zet in theorie alle beschikbare materie om naar paperclips. Dit heet een instrumental convergence probleem.
Constitutional AI
Anthropic ontwikkelde Constitutional AI (CAI): een methode waarbij het model zichzelf beoordeelt aan de hand van een set principes (een constitutie). Dit vermindert de noodzaak van menselijke feedback voor elke edge case en maakt het alignment-proces transparanter en schaalbaar.
Interpretability
Mechanistic interpretability onderzoekt wat er intern in een neuraal netwerk gebeurt. Circuits, features en superposition zijn centrale begrippen. Het doel: begrijpen waarom een model iets produceert, niet alleen wat. Anthropic, DeepMind en academische groepen publiceren hier actief onderzoek over.
Existentiele risicos
Organisaties als het Center for AI Safety en Anthropic zelf waarschuwen dat zeer krachtige toekomstige AI existentiele risicos kan inhouden als alignment niet is opgelost. Dit is controversieel: andere onderzoekers achten nabijetermijn schade (bias, fraude, deepfakes) urgenter. Beide zijn legitieme zorgen.