Stable Audio 3: generator podkładów AI, licencja, ceny i ComfyUI
Stable Audio 3 robi instrumentale i efekty do 6:20, ma otwarte wagi i licencję komercyjną do 1 mln USD przychodu. Sprawdziłem wersje, ceny, ranking i uruchomienie w ComfyUI.

👁 116 przeczytań
- Stable Audio 3 generuje instrumentale i efekty dźwiękowe do 6 minut 20 sekund, ale nie śpiewa tekstu - wokal jest całkowicie niedostępny.
- Trzy z czterech modeli (Small Music, Small SFX i Medium) mają otwarte wagi i można ich używać komercyjnie bez opłat, jeśli firma ma mniej niż 1 mln USD przychodu rocznie.
- W rankingu AA-Music-Instrumental v1.1 model Large zajął 8. miejsce z wynikiem Elo 1017, a Medium 14. miejsce z wynikiem 998, przy czym Suno v6 prowadzi z wynikiem 1140.
Stable Audio to generator muzyki i efektów dźwiękowych od Stability AI. Najnowsza rodzina Stable Audio 3 (maj 2026) robi instrumentale i dźwięki do 6 minut 20 sekund, ale nie śpiewa tekstu. Trzy z czterech modeli mają otwarte wagi, więc uruchomisz je za darmo na własnym komputerze, także do użytku komercyjnego, jeśli twoja firma ma mniej niż 1 mln USD przychodu rocznie.
Stan na 8 października 2026
- Najnowsze modele: Stable Audio 3 Small Music, Small SFX, Medium i Large (premiera 20 maja 2026).
- Otwarte wagi: Small Music, Small SFX i Medium na Hugging Face. Large tylko przez API i w umowach Enterprise.
- Wokal: brak. Modele robią instrumentale, pojedyncze instrumenty, efekty i sample.
- Licencja: Stability AI Community License - użycie komercyjne bez opłat do 1 mln USD przychodu rocznie.
- Ceny: stableaudio.com od 0 do 199 USD/mies., API Stability 0,26 USD za generację, na fal.ai Medium 0,0376 USD za klip.
- Ranking: w instrumentalnym rankingu Artificial Analysis Large jest 8., Medium 14.
Co to jest Stable Audio
Stable Audio to linia modeli audio od Stability AI, firmy znanej ze Stable Diffusion. Pierwsza wersja wystartowała we wrześniu 2023, 2.0 w kwietniu 2024, a 2.5 10 września 2025. Były też otwarte Stable Audio Open (do 47 s) i Open Small (11 s).
Stable Audio 3 to duży skok. Small generuje do 2 minut, Medium i Large do 380 sekund, czyli 6:20. Wszystkie modele zwracają stereo 44,1 kHz. Dzięki dodatkowemu etapowi treningu potrzebują kilku kroków zamiast kilkudziesięciu - szablon ComfyUI używa 8.
Ważne ograniczenie: Stable Audio nie śpiewa. Dokumentacja wprost mówi, że modele nie dają zrozumiałego wokalu, czasem tylko „wokalne tekstury” bez słów. Opisy muszą być po angielsku, bo na takich model był trenowany - inne języki działają gorzej. Do piosenek z tekstem wybierz Suno, Eleven Music albo Lyrię.
Wersje Stable Audio 3
| Model | Parametry | Maks. długość | Do czego | Gdzie |
|---|---|---|---|---|
| Small Music | 433 mln | 120 s | muzyka, instrumenty solo | otwarte wagi (2,27 GB), działa na CPU |
| Small SFX | 433 mln | 120 s | efekty dźwiękowe, sample | otwarte wagi (2,27 GB), działa na CPU |
| Medium | 1,4 mld | 380 s | muzyka, stemy, efekty | otwarte wagi (9,22 GB), karta NVIDIA |
| Large | 2,7 mld | 380 s | najlepsza jakość | API Stability, stableaudio.com, fal.ai |
Dane z repozytorium Stability na GitHubie. Blog Stability podaje dla Small 459 mln parametrów, a jeden z opisów w repozytorium daje Medium „około 4,75 min” zamiast 380 s.
Wszystkie modele obsługują trzy tryby:
- text-to-audio - opis tekstowy i długość w sekundach,
- audio-to-audio - twoje nagranie jako punkt wyjścia, parametr
init_noise_leveldecyduje, ile z oryginału zostanie, - inpainting i kontynuacja - podmiana wybranego fragmentu (także kilku naraz) albo przedłużenie nagrania.
Do tego dochodzi trening LoRA, czyli dostrajanie modelu do własnego stylu na twoich nagraniach. Stability po raz pierwszy opublikowało do tego dokumentację. Trenuje się na checkpointach „base”, a gotową LoRA nakłada na zwykły model. Na fal.ai jest gotowy trener (fal-ai/stable-audio-3-trainer), strona podaje koszt 3 USD za 1000 kroków.
Stable Audio w rankingu Artificial Analysis
W ślepym, instrumentalnym rankingu AA-Music-Instrumental v1.1 (około 7 października 2026, 1000 promptów z 17 gatunków) wyniki są takie:
| Miejsce | Model | Wynik Elo |
|---|---|---|
| 1 | Suno v6 | 1140 |
| - | Mureka V9 | 1081 |
| - | Lyria 3 Pro | 1078 |
| 8 | Stable Audio 3 Large | 1017 |
| - | MiniMax Music 3.0 (punkt odniesienia) | 1000 |
| 14 | Stable Audio 3 Medium | 998 |
| 16 | Stable Audio 2.5 | 986 |
| 17 | Stable Audio 3 Small | 948 |
Medium jest praktycznie na poziomie MiniMax Music 3.0, a to model, który ściągniesz i odpalisz u siebie. Do Suno v6 brakuje mu jednak ponad 140 punktów. W rankingu z wokalem Stable Audio nie występuje, bo nie śpiewa. Pełne zestawienie opisuję w tekście Ranking generatorów muzyki AI.
Licencja: co wolno z muzyką ze Stable Audio
Otwarte modele są na Stability AI Community License (wersja z 5 lipca 2024). Sprawdziłem tekst licencji, najważniejsze punkty:
- Do 1 mln USD przychodu rocznie możesz używać modeli komercyjnie bez opłat. Liczy się cały przychód firmy z podmiotami powiązanymi.
- Powyżej 1 mln USD potrzebujesz licencji Enterprise - Stability dorzuca w niej ochronę prawną (indemnifikację).
- Wygenerowane audio należy do ciebie „w zakresie dozwolonym przez prawo”.
- Rejestracja - przy użyciu komercyjnym trzeba się zarejestrować u Stability AI.
- Oznaczenie - produkt lub usługa zbudowana na modelu ma mieć dopisek „Powered by Stability AI” (na stronie, w dokumentacji albo w opisie).
- Zakaz trenowania innych dużych modeli generatywnych na wynikach albo wagach.
Repozytorium na Hugging Face jest bramkowane: przed pobraniem podajesz imię, e-mail, kraj i cel użycia. Medium zawiera też enkoder tekstu z rodziny Gemma, więc dochodzą warunki Gemma Terms of Use. Same modele trenowano na danych licencjonowanych z biblioteki AudioSparx i nagraniach CC0 z Freesound - według pracy technicznej to łącznie ok. 1,28 mln nagrań. To mocny argument przy reklamach i treściach dla klientów - Suno i Udio musiały się układać z wytwórniami po pozwach o nagrania użyte do treningu.
Ile kosztuje Stable Audio
Lokalnie płacisz tylko za prąd. W chmurze masz aplikację, API Stability albo fal.ai.
| Plan stableaudio.com | Cena | Kredyty miesięcznie | Ile utworów (wg Stability) | Licencja |
|---|---|---|---|---|
| Free | 0 USD | 50 | ok. 12 | tylko osobista, niekomercyjna |
| Solo | 12 USD/mies. | 660 | ok. 165 | komercyjna |
| Session | 30 USD/mies. | 1800 | ok. 450 | komercyjna |
| Producer | 90 USD/mies. | 6000 | ok. 1500 | komercyjna |
| Studio | 199 USD/mies. | 14 000 | ok. 3500 | komercyjna |
Cennik sprawdziłem 8 października 2026. Liczba utworów dotyczy pełnego miksu, przy generowaniu wielościeżkowym (stemy, na razie eksperymentalne) wychodzi o jedną trzecią mniej. Kredyty nie przechodzą na kolejny miesiąc. Każdy plan daje też wtyczkę do DAW (Ableton, Logic, Pro Tools). Stare plany Pro 11,99 USD i Studio 29,99 USD, podawane w wielu recenzjach, są nieaktualne. Uważaj też na strony stableaudio3.com, stableaudio3.org i stableaudio.net - to nie są serwisy Stability AI.
Ceny dla programistów:
- API Stability: Stable Audio 3 kosztuje 26 kredytów za generację (1 kredyt = 0,01 USD, czyli 0,26 USD), długość 1-380 s. Stable Audio 2.5 - 20 kredytów. Na start jest 25 darmowych kredytów.
- fal.ai Medium: 0,0376 USD za klip (text-to-audio), inpainting 0,0442 USD.
- fal.ai Large: 0,00125 USD za sekundę pracy serwera.
Jak uruchomić Stable Audio 3 lokalnie w ComfyUI
Najprostsza droga na Windowsie to ComfyUI z oficjalnym szablonem. Oficjalne repozytorium Stability wymaga dla Medium biblioteki Flash Attention 2 i instrukcja jest pisana pod Linuksa.
- Zaktualizuj ComfyUI do najnowszej wersji (szablony Stable Audio 3 są w pakiecie Comfy-Org/workflow_templates).
- Pobierz z repozytorium Comfy-Org/stable-audio-3 na Hugging Face plik
stable_audio_3_medium.safetensors(9,22 GB) do folderumodels/checkpoints. Słabszy komputer:stable_audio_3_small_music.safetensors(2,27 GB). - Pobierz enkoder tekstu
t5gemma_b_b_ul2.safetensors(1,18 GB) domodels/text_encoders. - Opcjonalnie:
qwen3.5_2b_bf16.safetensorsz Comfy-Org/Qwen3.5. Szablon używa tego małego modelu językowego, żeby z krótkiego pomysłu zrobić szczegółowy opis (tryby Music, Instrument, SFX, One-shot). - W ComfyUI otwórz przeglądarkę szablonów (Templates), przejdź do szablonów audio i wybierz „Stable Audio 3 Medium” (plik
audio_stable_audio_3_medium). - Wpisz opis po angielsku, ustaw długość w sekundach (domyślnie 150) i kliknij Run. Plik MP3 trafi do
output/audio/stable_audio_3.
Wymagania sprzętowe: według repozytorium Stability Medium zajmuje na karcie od 5,07 GB (5 s audio) do 6,52 GB (380 s), a dekodowanie w kawałkach obniża to o ponad 1 GB. Small działa nawet na samym procesorze, także na Macu. Sam plik Medium dla ComfyUI ma jednak 9,22 GB, więc ile pamięci zajmie w praktyce, sprawdziłem na własnej karcie - wyniki są w teście niżej.
Mój test
3 października 2026 przez fal.ai Stable Audio 3 Medium zrobił 60 sekund podkładu w 18,7 s. Nagranie i porównanie z modelami z wokalem są w przewodniku Generator muzyki AI.
Test lokalny na RTX 4090 (8 października 2026)
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Uruchomiłem Stable Audio 3 Medium w ComfyUI (plik stable_audio_3_medium.safetensors 9,22 GB i enkoder t5gemma 1,19 GB), z ustawieniami z oficjalnego szablonu: 8 kroków, cfg 1, sampler lcm. Polecenie po angielsku napisałem sam, bez dodatkowego modelu, który w szablonie rozpisuje krótki pomysł na pełny opis.
| Nagranie | Długość | Czas generowania | Pamięć karty (szczyt) | Brzmienie: Gemini / Qwen |
|---|---|---|---|---|
| Podkład indie pop, próba 1 (pierwsze uruchomienie) | 60 s | 214,9 s z ładowaniem modelu | 11,8 GB | 4,5 / 5 |
| Podkład indie pop, próba 2 | 60 s | 4,0 s | 9,2 GB | 4,5 / 3 |
| Podkład do rolki, 124 BPM | 30 s | 4,0 s | 7,9 GB | 4 / 3 |
- Szybkość robi wrażenie: gdy model jest już w pamięci, minuta muzyki powstaje w 4 sekundy. Pierwsze uruchomienie trwa długo, bo wczytuję model z dysku USB (ok. 44 MB/s).
- Pamięć karty: w ComfyUI szczyt wyniósł 7,9-11,8 GB, więcej niż 6,5 GB podane w repozytorium, ale wciąż mieści się na karcie 12 GB.
- Jakość wg sędziów AI (Gemini 3.8 Flash i Qwen 3.8 Omni Flash przez OpenRouter, 3 nagrania): średnio brzmienie 4,0/5, zgodność ze stylem 4,6, muzykalność 4,0. Qwen wytknął „pudełkową” perkusję i powtarzalny motyw gitary, Gemini ocenił pierwszy podkład jako poziom biblioteki muzyki.
- Wokalu nie ma w żadnym nagraniu - zgodnie z opisem modelu.
Ten sam styl z wokalem i polskim tekstem śpiewały w tej serii Eleven Music, Lyria 3 Pro, ACE-Step i MiniMax Music - wyniki w rankingu generatorów muzyki AI.
Do czego się nadaje
- Podkłady do rolek i filmów - instrumental o konkretnym tempie (BPM) i nastroju, przycięty do długości filmu.
- Efekty dźwiękowe - Small SFX i Medium robią trzaski, uderzenia, przejścia, ambienty. Najlepiej działa krótka długość i dopisek
TrackType: SFX. - Pętle i sample - pojedyncze instrumenty (
TrackType: Instrument), perkusja, basy do własnych bitów. - Przeróbki nagrań - audio-to-audio zmienia styl twojego szkicu, inpainting podmienia przejście albo wstawkę.
Z dokumentacji: lepsze wyniki dają tagi w stylu biblioteki AudioSparx, np. TrackType: Music, VocalType: Instrumental, Genre: Funk, Instruments: Guitar, Saxophone, oraz tempo w BPM. Więcej narzędzi do dźwięku zebrałem w tekście AI do muzyki.
Stable Audio na tle konkurencji
| Stable Audio 3 | Suno (instrumental) | Eleven Music | Lyria 3 Pro | MiniMax Music 3 | |
|---|---|---|---|---|---|
| Wokal | nie | tak (można wyłączyć) | tak | tak | tak |
| Elo instrumental AA | 1017 (Large), 998 (Medium) | 1140 (v6) | - | 1078 | 1000 |
| Otwarte wagi | tak (Small, Medium) | nie | nie | nie | nie |
| Komercja | Community do 1 mln USD, płatne plany | płatne plany | od Starter | niepotwierdzone | niepotwierdzone |
| Koszt przez fal.ai | 0,0376 USD (Medium) | brak API | 0,65 USD w moim teście | 0,08 USD w moim teście | 0,05 USD w moim teście |
Drugi otwarty model, ACE-Step 1.5 (licencja MIT), śpiewa - w moim teście 8 października zaśpiewał poprawnie 101 ze 104 słów polskiego tekstu. Do piosenek wybierz jego albo MiniMax Music 3, do podkładów Stable Audio. Opisy konkurentów: Suno, Eleven Music, Lyria, Mureka, MiniMax Music.
Dla kogo jest Stable Audio
- Dla ciebie, jeśli montujesz filmy i rolki i potrzebujesz podkładów bez ryzyka roszczeń.
- Dla ciebie, jeśli masz kartę NVIDIA i chcesz generować bez limitów i abonamentu - zobacz też lokalne AI.
- Dla ciebie, jeśli robisz gry, aplikacje albo dźwięki interfejsu i potrzebujesz efektów.
- Nie dla ciebie, jeśli chcesz piosenkę z tekstem, zwłaszcza po polsku.
- Nie dla ciebie, jeśli liczy się tylko najwyższa jakość instrumentalu - wtedy wygrywa Suno v6.
Najczęstsze pytania
Stable Audio - co to jest?
To generator muzyki i efektów dźwiękowych od Stability AI. Z opisu po angielsku tworzy instrumentalny utwór, pętlę albo efekt. Najnowsza wersja to Stable Audio 3 z maja 2026, dostępna w aplikacji stableaudio.com, przez API i jako otwarte wagi.
Jak uruchomić Stable Audio 3 lokalnie?
Najprościej w ComfyUI: pobierz checkpoint Medium (9,22 GB) i enkoder t5gemma (1,18 GB) z Comfy-Org/stable-audio-3, otwórz szablon „Stable Audio 3 Medium” i wpisz opis. Small Music działa nawet bez karty graficznej.
Czy Stable Audio jest za darmo?
Tak, na dwa sposoby. Plan Free na stableaudio.com daje 50 kredytów miesięcznie (ok. 12 utworów) do użytku niekomercyjnego. Otwarte modele Small i Medium uruchomisz u siebie bez opłat, także komercyjnie do 1 mln USD przychodu rocznie.
Czy muzykę ze Stable Audio można wykorzystać komercyjnie?
Tak. W aplikacji od planu Solo (12 USD/mies.), a z otwartymi modelami na licencji Community, jeśli firma ma poniżej 1 mln USD przychodu rocznie. Powyżej tego progu potrzebna jest licencja Enterprise. Plan Free w aplikacji jest tylko do użytku osobistego.
Czy Stable Audio śpiewa?
Nie. Stable Audio 3 nie generuje zrozumiałego wokalu, czasem tylko wokalne tła bez słów. Do piosenek z tekstem potrzebujesz Suno, Eleven Music albo Lyrii.
Stable Audio czy Suno?
Do piosenek z wokalem i do najlepszego instrumentalu - Suno (1140 Elo wobec 1017 dla Stable Audio 3 Large). Do pracy lokalnej, efektów dźwiękowych, edycji fragmentów i własnych LoRA - Stable Audio.
Jaki jest najlepszy generator podkładów AI?
Jakościowo prowadzi Suno v6 w trybie instrumentalnym. Najtańszy i bez limitów jest Stable Audio 3 Medium lokalnie, a przez API kosztuje 0,0376 USD za klip na fal.ai. Pełne porównanie jest w przewodniku Generator muzyki AI.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Źródła i data sprawdzenia
- Stability AI: premiera Stable Audio 3.0 (20.05.2026).
- GitHub Stability-AI/stable-audio-3: tabela modeli, pomiary VRAM, przewodnik po promptach, opis architektury i danych - sprawdzone 8.10.2026.
- Praca techniczna Stable Audio 3 (arXiv, 18.05.2026).
- Hugging Face: stable-audio-3-medium i Comfy-Org/stable-audio-3 - sprawdzone 8.10.2026.
- Stability AI Community License (wersja z 5.07.2024).
- Cennik stableaudio.com i cennik API Stability - sprawdzone 8.10.2026.
- fal.ai: Stable Audio 3 Medium i trener LoRA - sprawdzone 8.10.2026.
- Artificial Analysis: ranking instrumentalny (v1.1, ok. 7.10.2026).
- Stability AI: Stable Audio 2.5 (10.09.2025).
- Test własny 3.10.2026 przez fal.ai - szczegóły w przewodniku Generator muzyki AI.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
