Słownik AI / Multimodalność
🧠 Podstawy
Multimodalność
Zdolność modelu do pracy z wieloma rodzajami treści naraz: tekstem, obrazem, dźwiękiem, wideo.
Multimodalność to zdolność modelu do pracy z różnymi rodzajami danych jednocześnie: tekstem, obrazem, dźwiękiem i wideo. Model multimodalny obejrzy zdjęcie i opisze, co na nim jest, przeanalizuje wykres z raportu albo wysłucha nagrania i je streści.
To jeden z najważniejszych kierunków rozwoju AI, bo świat nie składa się z samego tekstu. W praktyce multimodalność oznacza, że do czatu wrzucasz zrzut ekranu z błędem, zdjęcie dokumentu czy nagranie ze spotkania - i pracujesz na nich tak samo naturalnie jak na tekście.
Pojęcia powiązane