✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

MiniMax Music 3: lokalnie, licencja, ceny i czy śpiewa po polsku

MiniMax Music 3 tworzy piosenki do 5 minut i od sierpnia 2026 ma otwarte wagi. Opisuję wersje, ranking, licencję, ceny aplikacji i fal.ai, instalację w ComfyUI krok po kroku oraz polską wymowę w moim teście.

10 min czytania
minimax-music

👁 116 przeczytań

// w skrócie
  • MiniMax Music 3 śpiewa po polsku zrozumiale, ale z akcentem - w teście na RTX 4090 Whisper large-v3 rozpoznał 102 ze 104 słów z polskiego tekstu.
  • Otwarte wagi MiniMax Music 3 dostępne są od sierpnia 2026 na Hugging Face na licencji komercyjnej, ale wymagają widocznego napisu "MiniMax-Music3" w produkcie i mają limit 20 mln USD przychodu rocznie.
  • W rankingu Artificial Analysis (ok. 7 października 2026) MiniMax Music 3.0 zajął 11. miejsce w piosenkach z wokalem z wynikiem 1000, podczas gdy lider Suno v6 uzyskał 1142.

MiniMax Music to generator piosenek chińskiego MiniMax, tego samego, który robi wideo Hailuo. Najnowszy Music 3 tworzy utwór z wokalem do 5 minut i od sierpnia 2026 ma otwarte wagi, więc uruchomisz go za darmo na własnej karcie graficznej w ComfyUI. Po polsku śpiewa zrozumiale, ale z akcentem, a płatne API dla nowych klientów MiniMax zamknął 20 sierpnia.

Stan na 8 października 2026

  • Model: MiniMax Music 3 (w API i aplikacji „Music-3.0”) - w API od 16 lipca, otwarte wagi na Hugging Face od sierpnia 2026.
  • Możliwości: piosenka do 5 minut, 32 kHz stereo, tekst ze znacznikami sekcji, wersja instrumentalna, cover z wgranego utworu (w aplikacji).
  • Gdzie: aplikacja MiniMax Audio (minimax.io/audio, dawniej Hailuo Audio), fal.ai, lokalnie w ComfyUI i diffusers.
  • API MiniMax: od 20.08.2026 zamknięte dla nowych użytkowników, darmowe endpointy music-3.0-free i music-2.6-free wyłączone.
  • Licencja wag: komercja dozwolona, ale z widocznym napisem „MiniMax-Music3” w produkcie i limitem 20 mln USD przychodu rocznie.
  • Ranking Artificial Analysis: 11. miejsce w piosenkach z wokalem, najlepszy model z otwartymi wagami.

Co to jest MiniMax Music

MiniMax to szanghajska firma od modeli językowych, wideo (Hailuo, H3) i głosu. O firmie i wideo piszę w hubie MiniMax: Hailuo, H3 i H3 Max, tu zajmuję się tylko muzyką.

MiniMax Music działa jak Suno: podajesz opis stylu i tekst piosenki, a model komponuje melodię, aranżację i śpiewa. Music 3 przyjmuje dwa wejścia:

  • Tekst z sekcjami - znaczniki [Intro], [Verse], [Pre-Chorus], [Chorus], [Bridge], [Instrumental], [Solo], [Outro]. Znaczniki model wykonuje dosłownie.
  • Structured Caption - opis w trzech częściach: Global Metadata (gatunek, tempo, tonacja, nastrój), Vocal Details (rodzaj głosu, sposób śpiewu) i Arrangement (instrumenty i co dzieje się w każdej sekcji).

Pod spodem: Global LLM 8B (na bazie Qwen3-8B) pilnuje struktury, Local LLM 0,6B szczegółów, Flow Matching 2,4B syntetyzuje dźwięk, a Flow-VAE 123M daje WAV 32 kHz stereo.

Wersje MiniMax Music

WersjaPremieraCo wniosła
Music-1.5 (beta)20 czerwca 2025muzyka z opisu i tekstu
Music-1.511 września 2025utwory do 4 minut
Music-2.029 października 2025lepsza ekspresja wokalu
Music-2.516 stycznia 2026dokładniejsza kontrola szczegółów
Music-2.5+marzec 2026tryb instrumentalny
Music-2.6kwiecień 2026nowy cover, mocniejszy bas
Music-3.0 / Music 316 lipca 2026 (API), 13 sierpnia 2026 (ogłoszenie otwartych wag)do 5 minut, lepsze brzmienie, otwarte wagi

Daty pochodzą z notatek wydań MiniMax (dla 2.5+ i 2.6 podają tylko miesiąc). Repozytorium z wagami na Hugging Face powstało 7 sierpnia, ogłoszenie MiniMax i ComfyUI - 13 sierpnia 2026.

Ranking: gdzie jest MiniMax Music

Artificial Analysis w wersji 1.1 rankingu (ok. 7 października 2026, 1000 promptów, 17 gatunków) ustawiło Music 3.0 jako punkt odniesienia skali, z wynikiem dokładnie 1000. Wszystkie wyniki zebrałem w rankingu generatorów muzyki AI.

  • Piosenki z wokalem: Music 2.6 - 1001 (10. miejsce), Music 3.0 - 1000 (11.), Music 2.5+ - 987 (12.). Lider Suno v6 ma 1142.
  • Instrumentale: Music 2.5+ - 1005 (10.), Music 2.6 - 1002 (11.), Music 3.0 - 1000 (13.). Lider Suno v6 ma 1140.
  • Otwarte wagi: Music 3.0 to najwyżej oceniony model, który możesz pobrać i uruchomić u siebie.

Music 3 nie brzmi lepiej od 2.6 - jego przewagą są otwarte wagi, nie jakość.

Licencja otwartych wag MiniMax-Music3

Wagi nie są na licencji Apache ani MIT, tylko na własnej „MiniMax-Music3 COMMUNITY LICENSE”. Przeczytałem plik LICENSE w repozytorium (8.10.2026). Najważniejsze punkty:

  • Użycie komercyjne jest dozwolone, także w płatnym produkcie lub usłudze.
  • Obowiązek oznaczenia: produkt komercyjny musi widocznie pokazywać „MiniMax-Music3” w interfejsie.
  • Próg 20 mln USD: jeśli roczny przychód z produktów i usług opartych na modelu przekracza 20 mln USD, potrzebna jest wcześniejsza pisemna zgoda MiniMax (kontakt [email protected]).
  • Zabezpieczenia: kto udostępnia model innym jako usługę, musi wdrożyć i okresowo sprawdzać „rozsądne i proporcjonalne” zabezpieczenia przed użyciem i wynikami łamiącymi licencję.
  • Acceptable Use Policy (aneks z 6 sierpnia 2026) zakazuje m.in. dezinformacji, podszywania się pod innych, dyskryminacji i zastosowań wojskowych.

Oznaczenie i próg przychodu dotyczą produktów i usług zbudowanych na modelu, nie samych utworów. Licencja nie mówi wprost, czyja jest wygenerowana muzyka - nie zastrzega jej dla MiniMax. Piosenka zrobiona lokalnie i wrzucona na YouTube nie wymaga napisu „MiniMax-Music3”, ale obowiązuje cię Acceptable Use Policy. Wzmianki o CC BY-NC 4.0 na niektórych blogach plik w repozytorium nie potwierdza.

Ile kosztuje MiniMax Music

Aplikacja MiniMax Audio

Muzykę robi się w MiniMax Audio (minimax.io/audio/music), dawniej pod adresem hailuo.ai/audio. Kredyty są wspólne z syntezą mowy. Sprawdziłem, że jedna piosenka kosztuje 300 kredytów (przycisk Create przy dwóch wariantach pokazuje 600).

PlanCena miesięczniePrzy płatności rocznejKredytyPiosenek (wg MiniMax)
Free0 USD-10 tys.ok. 33
Starter5 USD4,50 USD (54 USD/rok)100 tys.ok. 330
Creator17 USD13 USD (156 USD/rok)330 tys.ok. 1100
Standard38 USD25 USD (300 USD/rok)750 tys.ok. 2500
Pro150 USD80 USD (960 USD/rok)3 mlnok. 10 000

Cennik z minimax.io/audio/subscribe, sprawdzony 8 października 2026. Cennika w złotych nie ma. Prawa komercyjne do nowych piosenek dają plany płatne. Przy Free strona jest niespójna: karta planu obiecuje komercję, a FAQ mówi, że darmowe plany to tylko użytek osobisty - przyjmij wersję z FAQ. Regulamin muzyczny (19.06.2025) wymaga oznaczania muzyki jako AI i zakazuje usuwania znaków wodnych MiniMax.

API

  • API MiniMax: Music-3.0 i Music-2.6 kosztowały 0,15 USD za utwór do 5 minut, generowanie tekstu 0,01 USD. Od 20 sierpnia 2026 nowi użytkownicy nie kupią dostępu, dotychczasowi płacący klienci korzystają dalej.
  • fal.ai: minimax/music-3 - 0,002 USD za sekundę muzyki, czyli 0,12 USD za minutę. Music 2.6 (fal-ai/minimax-music/v2.6) - 0,15 USD za utwór. Ceny sprawdziłem w API cennika fal 8.10.2026.

Jak uruchomić MiniMax Music 3 lokalnie w ComfyUI

To najprostsza droga. MiniMax opisuje też diffusers (według README 24 GB VRAM, z odciążaniem ok. 22 GB, ze strumieniowaniem warstw nawet 8 GB) i SGLang-Omni. Potrzebna karta NVIDIA z CUDA. Ogólne zasady doboru karty są w tekście Ile VRAM potrzeba, a samą instalację ComfyUI opisałem w poradniku ComfyUI.

  1. Zaktualizuj ComfyUI do najnowszej wersji. Bez tego nie zobaczysz węzłów MiniMax Music 3.
  2. Otwórz Template Library, dział Audio, i wybierz szablon audio_minimax_music_3 („Text to Music (MiniMax Music 3)”). ComfyUI zaproponuje pobranie brakujących plików.
  3. Pobierz pliki z repozytorium Comfy-Org/MiniMax-Music-3 do folderów:
    • models/diffusion_models/: minimax_music3_dit_fp16.safetensors (4,91 GB) albo na słabszą kartę minimax_music3_dit_int8_convrot.safetensors (2,5 GB),
    • models/text_encoders/: minimax_music3_text_encoder_pruned_int8_convrot.safetensors (9,2 GB),
    • models/vae/: minimax_music3_dav.safetensors (0,22 GB).
  4. W węźle MiniMaxMusic3TextEncode wklej opis w trzech częściach (Global Metadata, Vocal Details, Arrangement) i tekst ze znacznikami sekcji.
  5. W węźle EmptyMiniMaxMusic3LatentAudio ustaw długość w sekundach. Szablon ma 120 s, maksimum to ok. 300 s.
  6. Zostaw KSampler z ustawień szablonu: 30 kroków, cfg 1,7, sampler euler, scheduler simple.
  7. Dekodowanie: VAEDecodeAudio na mocnej karcie, VAEDecodeAudioTiled (przełącznik tiled_decode w szablonie), gdy brakuje VRAM przy długich utworach. Kafelki są wolniejsze i mogą zostawić szwy.
  8. Uruchom kolejkę. Wynik zapisuje się jako MP3 w output/audio/.

Ile pamięci potrzeba? Największy jest koder tekstu, nie model dźwięku. Zestaw int8 (DiT 2,5 GB + koder 9,2 GB + VAE) to ok. 11,9 GB, zestaw z DiT fp16 ok. 14,3 GB. Społeczność przygotowała wersje GGUF:

  • Abiray/MiniMax-Music3-GGUF - tylko DiT: od Q3_K_M (1,16 GB) do Q8_0 (2,7 GB) i F16 (4,98 GB). Koder i VAE bierzesz z Comfy-Org.
  • molbal/Minimax-Music3-GGUF - DiT i koder tekstu, koder w Q4_0 ok. 5,4 GB. Wymaga forka ComfyUI-GGUF.

Według localaimaster.com rozsądne minimum to karta 12 GB i 32 GB RAM, a 8 GB działa tylko z mocnym odciążaniem i jest wolne. Oryginalne repozytorium MiniMax (57,4 GB) do ComfyUI nie jest potrzebne. Szerszy przegląd modeli do uruchomienia u siebie jest w hubie Lokalne AI.

Mój test: MiniMax Music 3 na RTX 4090

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

8 października 2026 uruchomiłem MiniMax Music 3 lokalnie w ComfyUI (DiT fp16 4,91 GB, enkoder tekstu pruned int8 9,2 GB, VAE 0,22 GB, razem ok. 14,3 GB do pobrania z Comfy-Org na Hugging Face). Ustawienia jak w oficjalnym szablonie: 30 kroków, cfg 1,7, euler/simple, maks. 100 sekund. Dostał polską piosenkę „Rano w Łodzi” (2 zwrotki i refren, 52 słowa) i opis stylu: nostalgiczna ballada indie pop z kobiecym wokalem.

PróbaDługość utworuCzas generowaniaPamięć karty (szczyt)Słowa bez błędu (z 52)
1 (pierwsze uruchomienie)86 s182,9 s z ładowaniem modelu20,4 GB50
2 (model w pamięci)54,5 s52,2 s16,9 GB52
  • Wymowa jest dobra: Whisper large-v3 na wokalu wydzielonym Demucsem zapisał 102 ze 104 słów. Błędy: „wyszlę” zamiast „wyślę” i „pognięciona” zamiast „pognieciona”.
  • Styl gorszy: sędziowie AI (Gemini 3.8 Flash i Qwen 3.8 Omni Flash) dali średnio 4,0/5 za wymowę, ale tylko 3,1 za brzmienie i 2,9 za zgodność ze stylem. Gemini w obu próbach pisał, że zamiast ciepłej ballady wyszedł przerysowany numer w stylu musicalowym, z metalicznym nalotem na wokalu.
  • Długość jest nieprzewidywalna: druga próba skończyła się po 54,5 s - model zaśpiewał cały tekst, ale szybciej, niż zakładałem.
  • Dla porównania ACE-Step 1.5 na tej samej karcie zrobił 95 sekund w 8 s przy 13-14 GB pamięci karty, a wymowę sędziowie ocenili na 4,5.
  • 3 października w chmurze (fal.ai) MiniMax Music 3 zaśpiewał inny polski tekst gorzej: 32 z 39 słów, wymowa 3/5.
MiniMax Music 3 - fragment 28 s, lokalnie na RTX 4090, próba 1

Wyniki wszystkich modeli z tej serii są w rankingu generatorów muzyki AI. Pierwsze uruchomienie było wolne, bo wczytuję modele z dysku USB (ok. 44 MB/s) - na NVMe będzie szybciej.

MiniMax Music po polsku

MiniMax nie publikuje listy języków śpiewu. Demo Music 3 są po chińsku i angielsku, a „40+ języków” z cennika MiniMax Audio dotyczy syntezy mowy, nie muzyki.

Sprawdziłem to 3 października 2026 w teście do przewodnika Generator muzyki AI: ten sam polski tekst (39 słów), transkrypcja Whisperem large-v3, ocena wymowy przez Gemini.

  • Music 2.6: 34 z 39 słów, wymowa 2/5, 57 s generowania na fal.ai.
  • Music 3: 32 z 39 słów, wymowa 3/5, 120 s generowania. Utwór wyszedł krótszy, niż prosiłem (27 s zamiast 75 s).
  • Problem: oba modele położyły zbitkę „z Gdańska rusza”, refren był czysty.

Rada: opis stylu pisz po angielsku z dopiskiem „vocal singing in Polish, clear diction”, a tekst zostaw po polsku i unikaj zbitek spółgłosek w pierwszym wersie.

MiniMax Music a konkurencja

ModelWokalMaks. długośćPolski w moich testachLokalnieCena od
MiniMax Music 3tak5 min32/39 (3.10, fal.ai); 102/104 (8.10, lokalnie)tak (licencja Community)0,002 USD/s (fal.ai)
Suno v6tak8 minnie testowałem (brak API)niePro 49,99 zł/mies. (App Store PL)
Google Lyria 3.5tak3 min36/39 (3.10)nieaplikacja Gemini, Flow Music
Murekatakbrak danychnie testowałem, polskiego nie ma na liścieniePro 10 USD/mies.
ACE-Step 1.5takbrak danych101/104 (8.10, lokalnie)tak (MIT, u mnie 13-14 GB pamięci karty)za darmo
Stable Audio 3 Mediumnie6:20nie dotyczytak0,0376 USD za utwór (fal.ai)

Najlepiej po polsku śpiewał u mnie Eleven Music (39 z 39 słów 3 października i 103 ze 104 dziś). Wśród modeli do pobrania Music 3 ma najwyższe miejsce w rankingu Artificial Analysis, ale w moim teście 8 października ACE-Step 1.5 zaśpiewał polski tekst równie dobrze (101 ze 104 słów), lepiej trafił w styl i potrzebował mniej pamięci karty. Stara wersja ACE-Step na fal.ai 3 października zamieniała polski w bełkot (8 z 39 słów) - wersja 1.5 to inny model.

Dla kogo jest MiniMax Music

  • Dla posiadaczy karty 12-24 GB VRAM - piosenki bez abonamentu i limitu pobrań.
  • Dla twórców aplikacji - najmocniejszy otwarty model piosenek z komercją (z napisem „MiniMax-Music3”).
  • Dla piosenek po angielsku i podkładów instrumentalnych - tu model jest najmocniejszy.
  • Nie dla polskiej piosenki do publikacji - akcent jest słyszalny. Lepiej sprawdzi się Eleven Music albo Lyria.

Najczęstsze pytania

Co to jest MiniMax Music?

Generator piosenek AI firmy MiniMax. Z opisu stylu i tekstu tworzy utwór z wokalem do 5 minut. Najnowsza wersja Music 3 ma otwarte wagi i działa w aplikacji MiniMax Audio, na fal.ai i lokalnie.

Czy MiniMax Music 3 można uruchomić lokalnie?

Tak. Najprościej w ComfyUI z szablonu audio_minimax_music_3. Potrzebujesz karty NVIDIA, rozsądnie od 12 GB VRAM, i ok. 12-15 GB miejsca na pliki. Z GGUF i odciążaniem ruszy nawet na 8 GB, ale wolno.

Czy MiniMax Music jest za darmo?

Lokalnie tak, bez limitu. W aplikacji MiniMax Audio plan Free daje 10 tys. kredytów miesięcznie, czyli ok. 33 piosenki, ale według FAQ tylko do użytku osobistego. Darmowe API music-3.0-free wyłączono 20 sierpnia 2026.

Jaka jest licencja MiniMax Music 3?

MiniMax-Music3 Community License. Komercja jest dozwolona, produkt musi widocznie pokazywać „MiniMax-Music3”, a powyżej 20 mln USD rocznego przychodu potrzebna jest pisemna zgoda MiniMax. Te warunki dotyczą produktów opartych na modelu, nie samych piosenek.

Czy MiniMax Music śpiewa po polsku?

Tak, ale z akcentem. W moim teście Music 3 zaśpiewał poprawnie 32 z 39 słów, Music 2.6 - 34. MiniMax nie wymienia polskiego wśród języków muzyki.

Co to jest Hailuo Music?

Dawna nazwa modułu muzycznego w Hailuo AI. Dziś generator działa jako MiniMax Audio pod adresem minimax.io/audio/music, a adres hailuo.ai/audio prowadzi do tej samej usługi. Wideo Hailuo opisuję w tekście Hailuo AI.

Czy mogę zarabiać na piosenkach z MiniMax Music?

Z płatnego planu MiniMax Audio - tak, plany dają prawa komercyjne do nowych piosenek, ale regulamin wymaga oznaczenia muzyki jako AI. Z lokalnego modelu licencja nie zabrania komercji i nie zastrzega utworów dla MiniMax.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›