Safety in AI verwijst naar maatregelen en onderzoek gericht op het zoeken naar AI-systemen veilig, betrouwbaar en voordelig voor mensheid. Dit omvat het voorkomen van schadelijke resultaten, het waarborgen van transparantie, en het africhten van modellen op menselijke waarden.
AI Safety onderzoekt vraagstukken als uitlijning (hoe zorg je dat AI-doelstellingen samenvallen met menselijke waarden), bias-voorkoming, fairness, en het begrijpen en controleren van complex gedrag. Dit veld wordt steeds belangrijker naarmate AI-systemen krachtiger worden.