Het toekomstige OpenAI Astra-model zou een nieuwe redeneerarchitectuur gebruiken die bekend staat als recurrent depth of opaque recurrence. Volgens rapporten van The Information — bevestigd door TechCrunch — maakt deze techniek een deel van het redeneren van het model onleesbaar voor traditionele chain-of-thought monitoring, wat een flinke stroom aan alarmbelletjes bij AI-veiligheidsonderzoekers heeft doen afgaan.

Astra is bovendien het eerste OpenAI-model dat de Critical cybersecurity-drempel bereikt onder het Preparedness Framework van het bedrijf — een niveau dat autonome ontdekking en uitbuiting van onbekende kwetsbaarheden in geharde systemen omvat. De techniek zorgt ervoor dat betekenisvolle delen van de redenering zich afspelen in interne neurale activaties in plaats van in stap-voor-stap leesbare tekst, wat de controle door veiligheidsdeskundigen bemoeilijkt.

Redwood Research-CEO Buck Shlegeris en hoofdonderzoeker Ryan Greenblatt waarschuwden openlijk voor een race to the bottom op het gebied van interpreteerbare AI-architecturen. OpenAI-chief scientist Jakub Pachocki verdedigde het bedrijf en benadrukte dat chain-of-thought monitoring een kernonderdeel blijft van het researchprogramma. Both Anthropic en Google DeepMind zouden intern al discussiëren over vergelijkbare technieken. Astra is nog niet publiek beschikbaar; de meest geavanceerde cyberfuncties worden eerst getest via het beperkte Daybreak-partnerprogramma.