Multimodal AI verwijst naar AI-systemen die meerdere soorten invoer begrijpen en verwerken — niet alleen tekst, maar ook afbeeldingen, audio, video of andere datatypen. De term modaal verwijst naar een modaliteit, oftewel een type zintuiglijke of informatiekanaal.
Een multimodaal model kan bijvoorbeeld een foto analyseren en er een tekstuele beschrijving van geven, of een audiofragment omzetten naar een samenvatting. De meest geavanceerde modellen combineren al deze mogelijkheden in een enkel systeem dat naadloos tussen modaliteiten schakelt.
Multimodaliteit maakt AI veel breder inzetbaar. Denk aan medische diagnostiek waarbij beelden worden gecombineerd met patiëntgegevens, of aan toegankelijkheidssoftware die afbeeldingen beschrijft voor mensen met een visuele beperking.