🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Słownik AI / Multimodalność
🧠 Podstawy

Multimodalność

Zdolność modelu do pracy z wieloma rodzajami treści naraz: tekstem, obrazem, dźwiękiem, wideo.

Multimodalność to zdolność modelu do pracy z różnymi rodzajami danych jednocześnie: tekstem, obrazem, dźwiękiem i wideo. Model multimodalny obejrzy zdjęcie i opisze, co na nim jest, przeanalizuje wykres z raportu albo wysłucha nagrania i je streści.

To jeden z najważniejszych kierunków rozwoju AI, bo świat nie składa się z samego tekstu. W praktyce multimodalność oznacza, że do czatu wrzucasz zrzut ekranu z błędem, zdjęcie dokumentu czy nagranie ze spotkania - i pracujesz na nich tak samo naturalnie jak na tekście.

Pojęcia powiązane
LLMText-to-imageTTS / STT

← Wszystkie pojęcia w Słowniku AI

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro 440 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie