Model multimodalny (Multimodal Model) to system sztucznej inteligencji zdolny do jednoczesnego przetwarzania, analizowania i integrowania informacji pochodzących z różnych typów danych, takich jak tekst, obrazy, dźwięk czy wideo. W przeciwieństwie do modeli jednorodnych (unimodalnych), potrafi on łączyć sygnały z wielu źródeł, co pozwala na pełniejsze zrozumienie kontekstu i relacji między różnymi mediami. Dzięki temu modele multimodalne mogą realizować skomplikowane zadania, takie như generowanie podpisów do zdjęć, odpowiadanie na pytania dotyczące materiałów wideo czy prowadzenie naturalnej konwersacji głosowej. Taka architektura lepiej odzwierciedla sposób, w jaki ludzie postrzegają i interpretują otaczający świat za pomocą wielu zmysłów.



