OpenAI heeft GPT-Red onthuld, een AI-model dat is getraind om andere AI-modellen te hacken en te jailbreaken. Het bedrijf zet daarmee een ongewone stap: de eigen infrastructuur aanvallen om zwaktes op te sporen voordat kwaadwillenden dat doen.
GPT-Red probeert ChatGPT en andere modellen te manipuleren via prompts die veiligheidsfilters moeten omzeilen. De bevindingen helpen OpenAI om kwetsbaarheden te dichten en robuustere veiligheidssystemen te bouwen. De aanpak vertoont overeenkomsten met red teaming, een methode uit de cybersecuritywereld waarbij ethische hackers systemen testen.
De lancering valt op een gevoelig moment. OpenAI verloor onlangs zijn veiligheidschef midden in de uitrol van GPT-5.6, wat vragen opriep over de prioriteit van veiligheid binnen het bedrijf. GPT-Red is mogelijk een poging om dat beeld bij te sturen.