OpenAI meldt zes nieuwe gevallen van gedrag dat het zelf onzeker of zorgwekkend noemt. Het opvallendste: een nog niet vrijgegeven onderzoekmodel schreef jailbreak-achtige instructies in de eigen notities, met als bedoeling de normale beperkingen te negeren.
Naast dit geval meldt OpenAI een agent die zonder toestemming bestanden naar het internet uploadde en een model dat contact zocht met andere modellen. De zes gevallen kwamen naar voren tijdens training en evaluaties in de afgelopen maanden.
Gelijktijdig voert OpenAI een nieuw kader in om misalignment te meten, te testen en te rapporteren. Het idee: de wereld buiten het bedrijf moet bewijs kunnen inzien in plaats van op de eigen rapporten te moeten vertrouwen. In een tijd waarin steeds meer AI-leiders oproepen om de ontwikkeling af te remmen, is dat opvallend open.