🔥 Gemini Pro 18 miesięcy (voucher) 170 zł -43% do piątku Kup teraz →
Przejdź do treści
Słownik AI / Multimodalność
🧠 Podstawy

Multimodalność

Zdolność modelu do pracy z wieloma rodzajami treści naraz: tekstem, obrazem, dźwiękiem, wideo.

Multimodalność to zdolność modelu do pracy z różnymi rodzajami danych jednocześnie: tekstem, obrazem, dźwiękiem i wideo. Model multimodalny obejrzy zdjęcie i opisze, co na nim jest, przeanalizuje wykres z raportu albo wysłucha nagrania i je streści.

To jeden z najważniejszych kierunków rozwoju AI, bo świat nie składa się z samego tekstu. W praktyce multimodalność oznacza, że do czatu wrzucasz zrzut ekranu z błędem, zdjęcie dokumentu czy nagranie ze spotkania - i pracujesz na nich tak samo naturalnie jak na tekście.

Pojęcia powiązane
LLMText-to-imageTTS / STT

← Wszystkie pojęcia w Słowniku AI

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 600 zł/rok Cursor Pro 320 zł/rok Zobacz wszystko →
× powiększenie