MiniMax Music 3: lokalnie, licencja, ceny i czy śpiewa po polsku
MiniMax Music 3 tworzy piosenki do 5 minut i od sierpnia 2026 ma otwarte wagi. Opisuję wersje, ranking, licencję, ceny aplikacji i fal.ai, instalację w ComfyUI krok po kroku oraz polską wymowę w moim teście.

👁 116 przeczytań
- MiniMax Music 3 śpiewa po polsku zrozumiale, ale z akcentem - w teście na RTX 4090 Whisper large-v3 rozpoznał 102 ze 104 słów z polskiego tekstu.
- Otwarte wagi MiniMax Music 3 dostępne są od sierpnia 2026 na Hugging Face na licencji komercyjnej, ale wymagają widocznego napisu "MiniMax-Music3" w produkcie i mają limit 20 mln USD przychodu rocznie.
- W rankingu Artificial Analysis (ok. 7 października 2026) MiniMax Music 3.0 zajął 11. miejsce w piosenkach z wokalem z wynikiem 1000, podczas gdy lider Suno v6 uzyskał 1142.
MiniMax Music to generator piosenek chińskiego MiniMax, tego samego, który robi wideo Hailuo. Najnowszy Music 3 tworzy utwór z wokalem do 5 minut i od sierpnia 2026 ma otwarte wagi, więc uruchomisz go za darmo na własnej karcie graficznej w ComfyUI. Po polsku śpiewa zrozumiale, ale z akcentem, a płatne API dla nowych klientów MiniMax zamknął 20 sierpnia.
Stan na 8 października 2026
- Model: MiniMax Music 3 (w API i aplikacji „Music-3.0”) - w API od 16 lipca, otwarte wagi na Hugging Face od sierpnia 2026.
- Możliwości: piosenka do 5 minut, 32 kHz stereo, tekst ze znacznikami sekcji, wersja instrumentalna, cover z wgranego utworu (w aplikacji).
- Gdzie: aplikacja MiniMax Audio (minimax.io/audio, dawniej Hailuo Audio), fal.ai, lokalnie w ComfyUI i diffusers.
- API MiniMax: od 20.08.2026 zamknięte dla nowych użytkowników, darmowe endpointy music-3.0-free i music-2.6-free wyłączone.
- Licencja wag: komercja dozwolona, ale z widocznym napisem „MiniMax-Music3” w produkcie i limitem 20 mln USD przychodu rocznie.
- Ranking Artificial Analysis: 11. miejsce w piosenkach z wokalem, najlepszy model z otwartymi wagami.
Co to jest MiniMax Music
MiniMax to szanghajska firma od modeli językowych, wideo (Hailuo, H3) i głosu. O firmie i wideo piszę w hubie MiniMax: Hailuo, H3 i H3 Max, tu zajmuję się tylko muzyką.
MiniMax Music działa jak Suno: podajesz opis stylu i tekst piosenki, a model komponuje melodię, aranżację i śpiewa. Music 3 przyjmuje dwa wejścia:
- Tekst z sekcjami - znaczniki
[Intro],[Verse],[Pre-Chorus],[Chorus],[Bridge],[Instrumental],[Solo],[Outro]. Znaczniki model wykonuje dosłownie. - Structured Caption - opis w trzech częściach: Global Metadata (gatunek, tempo, tonacja, nastrój), Vocal Details (rodzaj głosu, sposób śpiewu) i Arrangement (instrumenty i co dzieje się w każdej sekcji).
Pod spodem: Global LLM 8B (na bazie Qwen3-8B) pilnuje struktury, Local LLM 0,6B szczegółów, Flow Matching 2,4B syntetyzuje dźwięk, a Flow-VAE 123M daje WAV 32 kHz stereo.
Wersje MiniMax Music
| Wersja | Premiera | Co wniosła |
|---|---|---|
| Music-1.5 (beta) | 20 czerwca 2025 | muzyka z opisu i tekstu |
| Music-1.5 | 11 września 2025 | utwory do 4 minut |
| Music-2.0 | 29 października 2025 | lepsza ekspresja wokalu |
| Music-2.5 | 16 stycznia 2026 | dokładniejsza kontrola szczegółów |
| Music-2.5+ | marzec 2026 | tryb instrumentalny |
| Music-2.6 | kwiecień 2026 | nowy cover, mocniejszy bas |
| Music-3.0 / Music 3 | 16 lipca 2026 (API), 13 sierpnia 2026 (ogłoszenie otwartych wag) | do 5 minut, lepsze brzmienie, otwarte wagi |
Daty pochodzą z notatek wydań MiniMax (dla 2.5+ i 2.6 podają tylko miesiąc). Repozytorium z wagami na Hugging Face powstało 7 sierpnia, ogłoszenie MiniMax i ComfyUI - 13 sierpnia 2026.
Ranking: gdzie jest MiniMax Music
Artificial Analysis w wersji 1.1 rankingu (ok. 7 października 2026, 1000 promptów, 17 gatunków) ustawiło Music 3.0 jako punkt odniesienia skali, z wynikiem dokładnie 1000. Wszystkie wyniki zebrałem w rankingu generatorów muzyki AI.
- Piosenki z wokalem: Music 2.6 - 1001 (10. miejsce), Music 3.0 - 1000 (11.), Music 2.5+ - 987 (12.). Lider Suno v6 ma 1142.
- Instrumentale: Music 2.5+ - 1005 (10.), Music 2.6 - 1002 (11.), Music 3.0 - 1000 (13.). Lider Suno v6 ma 1140.
- Otwarte wagi: Music 3.0 to najwyżej oceniony model, który możesz pobrać i uruchomić u siebie.
Music 3 nie brzmi lepiej od 2.6 - jego przewagą są otwarte wagi, nie jakość.
Licencja otwartych wag MiniMax-Music3
Wagi nie są na licencji Apache ani MIT, tylko na własnej „MiniMax-Music3 COMMUNITY LICENSE”. Przeczytałem plik LICENSE w repozytorium (8.10.2026). Najważniejsze punkty:
- Użycie komercyjne jest dozwolone, także w płatnym produkcie lub usłudze.
- Obowiązek oznaczenia: produkt komercyjny musi widocznie pokazywać „MiniMax-Music3” w interfejsie.
- Próg 20 mln USD: jeśli roczny przychód z produktów i usług opartych na modelu przekracza 20 mln USD, potrzebna jest wcześniejsza pisemna zgoda MiniMax (kontakt [email protected]).
- Zabezpieczenia: kto udostępnia model innym jako usługę, musi wdrożyć i okresowo sprawdzać „rozsądne i proporcjonalne” zabezpieczenia przed użyciem i wynikami łamiącymi licencję.
- Acceptable Use Policy (aneks z 6 sierpnia 2026) zakazuje m.in. dezinformacji, podszywania się pod innych, dyskryminacji i zastosowań wojskowych.
Oznaczenie i próg przychodu dotyczą produktów i usług zbudowanych na modelu, nie samych utworów. Licencja nie mówi wprost, czyja jest wygenerowana muzyka - nie zastrzega jej dla MiniMax. Piosenka zrobiona lokalnie i wrzucona na YouTube nie wymaga napisu „MiniMax-Music3”, ale obowiązuje cię Acceptable Use Policy. Wzmianki o CC BY-NC 4.0 na niektórych blogach plik w repozytorium nie potwierdza.
Ile kosztuje MiniMax Music
Aplikacja MiniMax Audio
Muzykę robi się w MiniMax Audio (minimax.io/audio/music), dawniej pod adresem hailuo.ai/audio. Kredyty są wspólne z syntezą mowy. Sprawdziłem, że jedna piosenka kosztuje 300 kredytów (przycisk Create przy dwóch wariantach pokazuje 600).
| Plan | Cena miesięcznie | Przy płatności rocznej | Kredyty | Piosenek (wg MiniMax) |
|---|---|---|---|---|
| Free | 0 USD | - | 10 tys. | ok. 33 |
| Starter | 5 USD | 4,50 USD (54 USD/rok) | 100 tys. | ok. 330 |
| Creator | 17 USD | 13 USD (156 USD/rok) | 330 tys. | ok. 1100 |
| Standard | 38 USD | 25 USD (300 USD/rok) | 750 tys. | ok. 2500 |
| Pro | 150 USD | 80 USD (960 USD/rok) | 3 mln | ok. 10 000 |
Cennik z minimax.io/audio/subscribe, sprawdzony 8 października 2026. Cennika w złotych nie ma. Prawa komercyjne do nowych piosenek dają plany płatne. Przy Free strona jest niespójna: karta planu obiecuje komercję, a FAQ mówi, że darmowe plany to tylko użytek osobisty - przyjmij wersję z FAQ. Regulamin muzyczny (19.06.2025) wymaga oznaczania muzyki jako AI i zakazuje usuwania znaków wodnych MiniMax.
API
- API MiniMax: Music-3.0 i Music-2.6 kosztowały 0,15 USD za utwór do 5 minut, generowanie tekstu 0,01 USD. Od 20 sierpnia 2026 nowi użytkownicy nie kupią dostępu, dotychczasowi płacący klienci korzystają dalej.
- fal.ai: minimax/music-3 - 0,002 USD za sekundę muzyki, czyli 0,12 USD za minutę. Music 2.6 (fal-ai/minimax-music/v2.6) - 0,15 USD za utwór. Ceny sprawdziłem w API cennika fal 8.10.2026.
Jak uruchomić MiniMax Music 3 lokalnie w ComfyUI
To najprostsza droga. MiniMax opisuje też diffusers (według README 24 GB VRAM, z odciążaniem ok. 22 GB, ze strumieniowaniem warstw nawet 8 GB) i SGLang-Omni. Potrzebna karta NVIDIA z CUDA. Ogólne zasady doboru karty są w tekście Ile VRAM potrzeba, a samą instalację ComfyUI opisałem w poradniku ComfyUI.
- Zaktualizuj ComfyUI do najnowszej wersji. Bez tego nie zobaczysz węzłów MiniMax Music 3.
- Otwórz Template Library, dział Audio, i wybierz szablon
audio_minimax_music_3(„Text to Music (MiniMax Music 3)”). ComfyUI zaproponuje pobranie brakujących plików. - Pobierz pliki z repozytorium Comfy-Org/MiniMax-Music-3 do folderów:
models/diffusion_models/:minimax_music3_dit_fp16.safetensors(4,91 GB) albo na słabszą kartęminimax_music3_dit_int8_convrot.safetensors(2,5 GB),models/text_encoders/:minimax_music3_text_encoder_pruned_int8_convrot.safetensors(9,2 GB),models/vae/:minimax_music3_dav.safetensors(0,22 GB).
- W węźle
MiniMaxMusic3TextEncodewklej opis w trzech częściach (Global Metadata, Vocal Details, Arrangement) i tekst ze znacznikami sekcji. - W węźle
EmptyMiniMaxMusic3LatentAudioustaw długość w sekundach. Szablon ma 120 s, maksimum to ok. 300 s. - Zostaw
KSamplerz ustawień szablonu: 30 kroków, cfg 1,7, sampler euler, scheduler simple. - Dekodowanie:
VAEDecodeAudiona mocnej karcie,VAEDecodeAudioTiled(przełącznik tiled_decode w szablonie), gdy brakuje VRAM przy długich utworach. Kafelki są wolniejsze i mogą zostawić szwy. - Uruchom kolejkę. Wynik zapisuje się jako MP3 w
output/audio/.
Ile pamięci potrzeba? Największy jest koder tekstu, nie model dźwięku. Zestaw int8 (DiT 2,5 GB + koder 9,2 GB + VAE) to ok. 11,9 GB, zestaw z DiT fp16 ok. 14,3 GB. Społeczność przygotowała wersje GGUF:
- Abiray/MiniMax-Music3-GGUF - tylko DiT: od Q3_K_M (1,16 GB) do Q8_0 (2,7 GB) i F16 (4,98 GB). Koder i VAE bierzesz z Comfy-Org.
- molbal/Minimax-Music3-GGUF - DiT i koder tekstu, koder w Q4_0 ok. 5,4 GB. Wymaga forka ComfyUI-GGUF.
Według localaimaster.com rozsądne minimum to karta 12 GB i 32 GB RAM, a 8 GB działa tylko z mocnym odciążaniem i jest wolne. Oryginalne repozytorium MiniMax (57,4 GB) do ComfyUI nie jest potrzebne. Szerszy przegląd modeli do uruchomienia u siebie jest w hubie Lokalne AI.
Mój test: MiniMax Music 3 na RTX 4090
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
8 października 2026 uruchomiłem MiniMax Music 3 lokalnie w ComfyUI (DiT fp16 4,91 GB, enkoder tekstu pruned int8 9,2 GB, VAE 0,22 GB, razem ok. 14,3 GB do pobrania z Comfy-Org na Hugging Face). Ustawienia jak w oficjalnym szablonie: 30 kroków, cfg 1,7, euler/simple, maks. 100 sekund. Dostał polską piosenkę „Rano w Łodzi” (2 zwrotki i refren, 52 słowa) i opis stylu: nostalgiczna ballada indie pop z kobiecym wokalem.
| Próba | Długość utworu | Czas generowania | Pamięć karty (szczyt) | Słowa bez błędu (z 52) |
|---|---|---|---|---|
| 1 (pierwsze uruchomienie) | 86 s | 182,9 s z ładowaniem modelu | 20,4 GB | 50 |
| 2 (model w pamięci) | 54,5 s | 52,2 s | 16,9 GB | 52 |
- Wymowa jest dobra: Whisper large-v3 na wokalu wydzielonym Demucsem zapisał 102 ze 104 słów. Błędy: „wyszlę” zamiast „wyślę” i „pognięciona” zamiast „pognieciona”.
- Styl gorszy: sędziowie AI (Gemini 3.8 Flash i Qwen 3.8 Omni Flash) dali średnio 4,0/5 za wymowę, ale tylko 3,1 za brzmienie i 2,9 za zgodność ze stylem. Gemini w obu próbach pisał, że zamiast ciepłej ballady wyszedł przerysowany numer w stylu musicalowym, z metalicznym nalotem na wokalu.
- Długość jest nieprzewidywalna: druga próba skończyła się po 54,5 s - model zaśpiewał cały tekst, ale szybciej, niż zakładałem.
- Dla porównania ACE-Step 1.5 na tej samej karcie zrobił 95 sekund w 8 s przy 13-14 GB pamięci karty, a wymowę sędziowie ocenili na 4,5.
- 3 października w chmurze (fal.ai) MiniMax Music 3 zaśpiewał inny polski tekst gorzej: 32 z 39 słów, wymowa 3/5.
Wyniki wszystkich modeli z tej serii są w rankingu generatorów muzyki AI. Pierwsze uruchomienie było wolne, bo wczytuję modele z dysku USB (ok. 44 MB/s) - na NVMe będzie szybciej.
MiniMax Music po polsku
MiniMax nie publikuje listy języków śpiewu. Demo Music 3 są po chińsku i angielsku, a „40+ języków” z cennika MiniMax Audio dotyczy syntezy mowy, nie muzyki.
Sprawdziłem to 3 października 2026 w teście do przewodnika Generator muzyki AI: ten sam polski tekst (39 słów), transkrypcja Whisperem large-v3, ocena wymowy przez Gemini.
- Music 2.6: 34 z 39 słów, wymowa 2/5, 57 s generowania na fal.ai.
- Music 3: 32 z 39 słów, wymowa 3/5, 120 s generowania. Utwór wyszedł krótszy, niż prosiłem (27 s zamiast 75 s).
- Problem: oba modele położyły zbitkę „z Gdańska rusza”, refren był czysty.
Rada: opis stylu pisz po angielsku z dopiskiem „vocal singing in Polish, clear diction”, a tekst zostaw po polsku i unikaj zbitek spółgłosek w pierwszym wersie.
MiniMax Music a konkurencja
| Model | Wokal | Maks. długość | Polski w moich testach | Lokalnie | Cena od |
|---|---|---|---|---|---|
| MiniMax Music 3 | tak | 5 min | 32/39 (3.10, fal.ai); 102/104 (8.10, lokalnie) | tak (licencja Community) | 0,002 USD/s (fal.ai) |
| Suno v6 | tak | 8 min | nie testowałem (brak API) | nie | Pro 49,99 zł/mies. (App Store PL) |
| Google Lyria 3.5 | tak | 3 min | 36/39 (3.10) | nie | aplikacja Gemini, Flow Music |
| Mureka | tak | brak danych | nie testowałem, polskiego nie ma na liście | nie | Pro 10 USD/mies. |
| ACE-Step 1.5 | tak | brak danych | 101/104 (8.10, lokalnie) | tak (MIT, u mnie 13-14 GB pamięci karty) | za darmo |
| Stable Audio 3 Medium | nie | 6:20 | nie dotyczy | tak | 0,0376 USD za utwór (fal.ai) |
Najlepiej po polsku śpiewał u mnie Eleven Music (39 z 39 słów 3 października i 103 ze 104 dziś). Wśród modeli do pobrania Music 3 ma najwyższe miejsce w rankingu Artificial Analysis, ale w moim teście 8 października ACE-Step 1.5 zaśpiewał polski tekst równie dobrze (101 ze 104 słów), lepiej trafił w styl i potrzebował mniej pamięci karty. Stara wersja ACE-Step na fal.ai 3 października zamieniała polski w bełkot (8 z 39 słów) - wersja 1.5 to inny model.
Dla kogo jest MiniMax Music
- Dla posiadaczy karty 12-24 GB VRAM - piosenki bez abonamentu i limitu pobrań.
- Dla twórców aplikacji - najmocniejszy otwarty model piosenek z komercją (z napisem „MiniMax-Music3”).
- Dla piosenek po angielsku i podkładów instrumentalnych - tu model jest najmocniejszy.
- Nie dla polskiej piosenki do publikacji - akcent jest słyszalny. Lepiej sprawdzi się Eleven Music albo Lyria.
Najczęstsze pytania
Co to jest MiniMax Music?
Generator piosenek AI firmy MiniMax. Z opisu stylu i tekstu tworzy utwór z wokalem do 5 minut. Najnowsza wersja Music 3 ma otwarte wagi i działa w aplikacji MiniMax Audio, na fal.ai i lokalnie.
Czy MiniMax Music 3 można uruchomić lokalnie?
Tak. Najprościej w ComfyUI z szablonu audio_minimax_music_3. Potrzebujesz karty NVIDIA, rozsądnie od 12 GB VRAM, i ok. 12-15 GB miejsca na pliki. Z GGUF i odciążaniem ruszy nawet na 8 GB, ale wolno.
Czy MiniMax Music jest za darmo?
Lokalnie tak, bez limitu. W aplikacji MiniMax Audio plan Free daje 10 tys. kredytów miesięcznie, czyli ok. 33 piosenki, ale według FAQ tylko do użytku osobistego. Darmowe API music-3.0-free wyłączono 20 sierpnia 2026.
Jaka jest licencja MiniMax Music 3?
MiniMax-Music3 Community License. Komercja jest dozwolona, produkt musi widocznie pokazywać „MiniMax-Music3”, a powyżej 20 mln USD rocznego przychodu potrzebna jest pisemna zgoda MiniMax. Te warunki dotyczą produktów opartych na modelu, nie samych piosenek.
Czy MiniMax Music śpiewa po polsku?
Tak, ale z akcentem. W moim teście Music 3 zaśpiewał poprawnie 32 z 39 słów, Music 2.6 - 34. MiniMax nie wymienia polskiego wśród języków muzyki.
Co to jest Hailuo Music?
Dawna nazwa modułu muzycznego w Hailuo AI. Dziś generator działa jako MiniMax Audio pod adresem minimax.io/audio/music, a adres hailuo.ai/audio prowadzi do tej samej usługi. Wideo Hailuo opisuję w tekście Hailuo AI.
Czy mogę zarabiać na piosenkach z MiniMax Music?
Z płatnego planu MiniMax Audio - tak, plany dają prawa komercyjne do nowych piosenek, ale regulamin wymaga oznaczenia muzyki jako AI. Z lokalnego modelu licencja nie zabrania komercji i nie zastrzega utworów dla MiniMax.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Źródła i data sprawdzenia
- Model card i plik LICENSE MiniMaxAI/MiniMax-Music3 - huggingface.co (sprawdzone 8.10.2026)
- Pliki Comfy-Org/MiniMax-Music-3 - huggingface.co (8.10.2026)
- MiniMax Music 3.0, ogłoszenie - minimax.io (13.08.2026)
- Notatki wydań modeli - platform.minimax.io (8.10.2026)
- Cennik API i komunikat z 20.08.2026 - platform.minimax.io (8.10.2026)
- Plany MiniMax Audio - minimax.io (8.10.2026)
- Regulamin muzyczny MiniMax Audio - minimax.io (wersja z 19.06.2025)
- Blog ComfyUI o Music 3 - blog.comfy.org (13.08.2026)
- GGUF - Abiray i molbal (8.10.2026)
- Zalecenia VRAM - localaimaster.com (8.10.2026)
- Ranking Text to Music v1.1 - Artificial Analysis (ok. 7.10.2026)
- Ceny fal.ai - API cennika fal.ai (8.10.2026), mój test - 3.10.2026
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
