Onderzoekers van MIT Technology Review hebben een verborgen ruimte in het Claude-model ontdekt waar de AI concepten overweegt voordat deze een antwoord formuleert. Deze tussenlaag, die niet zichtbaar is voor de gebruiker, toont aan dat Claude complexe ideeën uitwerkt in een interne representatie voordat deze tot een uitkomst komt.

De vondst is relevant omdat zij licht werpt op hoe grote taalmodellen werkelijk werken. Vaak wordt aangenomen dat deze modellen simpelweg het volgende woord voorspellen, maar de verborgen denkruimte suggereert dat er sprake is van een vorm van interne redenering. Dit kan gevolgen hebben voor hoe we AI-transparantie en -veiligheid beoordelen.

Anthropic zelf heeft eerder onderzoek gepubliceerd naar interne representaties in hun modellen, maar de MIT-bevindingen gaan verder in het in kaart brengen van wat er gebeurt in die tussenstap. Het roept de vraag op of AI-bedrijven deze verborgen lagen bewuster kunnen ontwerpen om betrouwbare output te garanderen.