Google heeft agentic video understanding gelanceerd voor Gemini, een nieuwe functie die video-analyse met tot 88% minder tokenverbruik mogelijk maakt en de kosten met tot 66% verlaagt, terwijl de nauwkeurigheid met tot 7% verbetert. De functie werkt met Gemini 3.7 Flash, 3.6 Flash en 3.5 Flash-Lite.
In tegenstelling tot statische verwerking waarbij het model video’s verwerkt met een vast aantal frames per seconde, neemt Gemini met agentic video understanding een actieve rol. Het model bepaalt zelf wat het moet bekijken, met welk tempo en via welke modality – visuele frames, audio of transcriptie. Het haalt alleen de momenten en signalen op die nodig zijn voor de query. Dit maakt sub-seconde moment retrieval, anomalie-detectie, nauwkeurig tellen van objecten en bewegingen, en complex zoeken over urenlang video-materiaal mogelijk zonder miljoenen tokens te verbruiken.
De functie is nu beschikbaar via de Gemini API in Google AI Studio en het Gemini Enterprise Agent Platform. Google brengt de verbeteringen ook naar miljarden gebruikers: binnenkort in de Gemini app voor Flash en Flash-Lite modellen, en in de komende maanden ook YouTube’s Ask YouTube functie op de video watch page.