Expert • Les 4
Multimodale AI: meer dan tekst
De nieuwste generatie AI-modellen is niet beperkt tot tekst. Ze verwerken afbeeldingen, audio, video en code binnen dezelfde architectuur. Dit heet multimodaliteit.
Vision encoders
Om afbeeldingen te begrijpen, wordt een afbeelding opgesplitst in patches en gecodeerd door een vision encoder (vaak gebaseerd op Vision Transformer, ViT). Die representatie wordt vervolgens gecombineerd met de tekstrepresentatie in het taalmodel.
Modellen die multimodaal zijn
GPT-4o, Claude 3 en Gemini 1.5 Pro verwerken tekst en afbeeldingen. Gemini 1.5 Pro verwerkt ook video en audio. Whisper (OpenAI) is gespecialiseerd in spraak-naar-tekst. Sora (OpenAI) en Veo (Google) genereren video op basis van tekst.
Uitdagingen
Multimodale modellen kunnen hallusineren over afbeeldingen: tekst lezen die er niet staat, objecten missen of relaties verkeerd interpreteren. Evaluatie van visuele begrip is moeilijker dan tekstuele evaluatie vanwege de hogere diversiteit aan invoer.
Toepassingen
Multimodale AI maakt mogelijk: automatische inspectie van productfotos, toegankelijkheidssoftware die afbeeldingen beschrijft voor slechtzienden, medische beeldanalyse, documentverwerking met tabellen en diagrammen, en interactieve productdesigntools.