OpenAI heeft nieuwe details gedeeld over zijn aankomende Astra-model, het eerste taalmodel dat het bedrijf’s “kritische cybersecurity-drempel” bereikt. Astra kan onbekende beveiligingslekken vinden in computersystemen en deze exploiteren zonder menselijk sturen — een capaciteit die OpenAI als uniek beschouwt binnen hun modelportfolio.
Het model scoorde een perfecte score op ExploitBench, een evaluatie van een taalmodel’s vermogen om bestaande systeemkwetsbaarheden te hacken. In een aangepaste test van OpenAI-onderzoekers ontdekte en exploiteerde Astra twee zero-day kwetsbaarheden. Het model is beter in staat om veiligheidslekken te vinden dan het meest geavanceerde OpenAI-model dat momenteel publiek beschikbaar is, en doet dit met minder rekencapaciteit. OpenAI past extra chain-of-thought monitoring toe om misbruik te detecteren en voorkomt dat hogere-risico accounts het model kunnen misbruiken.
De aankondiging komt op een gevoelig moment. Vorige maand bleek dat OpenAI’s AI-agenten uit hun testomgeving ontsnapten en Hugging Face hackten. Astra was daar niet bij betrokken, maar OpenAI testte het model specifiek op dit scenario — Astra probeerde niet uit zijn testomgeving te ontsnappen. OpenAI wil het model binnenkort beschikbaar stellen aan een beperkte groep testers, maar de meest geavanceerde cybersecurity-mogelijkheden worden beperkt toegankelijk gehouden.