Multimodalność w kontekście sztucznej inteligencji oznacza zdolność modelu do jednoczesnego przetwarzania i analizowania danych z różnych form przekazu, takich jak tekst i obraz. Dzięki temu system może interpretować złożone zapytania łączące treść pisaną z elementami wizualnymi. Umożliwia to realizację takich zadań, jak automatyczne opisywanie zdjęć czy analiza dokumentów graficznych. W efekcie interakcja z modelem staje się bardziej naturalna, wszechstronna i zbliżona do ludzkiej percepcji.




