Sprawdziłem HappyHorse 1.1: angielski bez błędu, polski z 6 błędami
Model wideo Alibaby po angielsku mówi bez błędu, a w polskim zdaniu pomylił 6 z 12 słów. Wyniki mojego testu i co z tego wynika dla rolek po polsku.

👁 118 przeczytań
Sprawdziłem model wideo HappyHorse 1.1 od Alibaby na polskim i angielskim zdaniu. Angielskie zdanie rybaka wyszło bez jednego błędu. W polskim zdaniu o chrząszczu model pomylił 6 z 12 słów. Klip kosztował 0,494 USD przez OpenRouter. Ranking, ceny i pełny test są w przewodniku HappyHorse 1.1.
Werdykt w skrócie (11 października 2026)
- Po angielsku: WER 0, usta zgodne z dźwiękiem.
- Po polsku: WER 0,5, czyli błąd w co drugim słowie.
- Polski napis w kadrze: „ŻÓLTA LŮDŻ” zamiast „ŻÓŁTA ŁÓDŹ”.
- Lepiej po polsku mówią: MiniMax H3 Max (WER 0) i Wan 3.0 (0,167).
Co sprawdziłem
11 października 2026 zrobiłem 7 klipów modelem HappyHorse 1.1 przez API OpenRoutera: 720p, 5 sekund, ten sam seed. Dwa z nich dotyczyły mowy. W pierwszym kobieta przy kuchennym stole miała powiedzieć po polsku: „W Szczebrzeszynie chrząszcz brzmi w trzcinie, a ja płacę trzydzieści dwa złote”. To samo polecenie dostało wcześniej sześć modeli w mojej Arenie wideo. W drugim starszy rybak na pomoście miał powiedzieć po angielsku: „The sea gives you exactly what you have patience for”.
Oba nagrania przepuściłem przez faster-whisper large-v3 i policzyłem WER, czyli odsetek źle odczytanych słów. Zero oznacza zdanie bez błędu.
Wynik po polsku: 6 z 12 słów źle
Whisper odczytał z klipu: „W Schebrzeszynie krząść brzmi w trzminie, ale ja płacię trzydzieściąć dwa złote”. Model uprościł „Szcz” do „Sch” w nazwie miasta, zamienił chrząszcza na „krząść”, trzcinę na „trzminę”, „a” na „ale” i dorobił nieistniejące formy „płacię” i „trzydzieściąć”. Obraz jest przy tym poprawny: twarz naturalna, usta się ruszają, głos brzmi jak prawdziwy. Słychać jednak, że to polski z obcym akcentem i z błędami. Dałem tej scenie 4,5/10.
Na tle innych modeli z tej samej sceny:
| Model | WER po polsku | Źle odczytane słowa (z 12) |
|---|---|---|
| MiniMax H3 Max | 0 | 0 |
| Wan 3.0 | 0,167 | 2 |
| Kling 3.0 Turbo | 0,333 | 4 |
| HappyHorse 1.1 | 0,5 | 6 |
| Seedance 2.5 | 0,583 | 7 |
Wyniki rywali pochodzą z rundy z 28 września 2026 (to samo polecenie). Producent nie podaje listy języków mowy. Pośrednicy wymieniają m.in. angielski, chiński, japoński, koreański, niemiecki, francuski i hiszpański. Polskiego nie wymienia nikt.
Po angielsku: bez błędu
Zdanie rybaka Whisper odczytał słowo w słowo, WER 0. Ruch ust zgadza się z dźwiękiem, w tle słychać fale. Jedyny minus: model sam dodał na początku krótkie zbliżenie dłoni, zanim pokazał plan średni. Ocena 8,5/10.
Ten sam model, ta sama rozdzielczość, ta sama długość. Różnica między WER 0 a WER 0,5 to wyłącznie język. Podobnie wyszło z polskim napisem na tablicy: zamiast „ARENA WIDEO 2026” i „ŻÓŁTA ŁÓDŹ” model napisał „ARENA WIDO 2026” i „ŻÓLTA LŮDŻ” (ocena 3/10).
Skąd ten model i gdzie jest w rankingu
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
HappyHorse to seria wideo Alibaby z grupy ATH (Alibaba Token Hub), rozwijana przez zespół Future Life Lab. Kolejne kroki:
- 7 kwietnia 2026 wersja 1.0 trafiła anonimowo na arenę Artificial Analysis i od razu objęła 1. miejsce.
- 10 kwietnia 2026 AA ujawniło, że to Alibaba.
- 22 czerwca 2026 wyszła wersja 1.1 z lepszym ruchem, spójnością postaci i tańszym 1080p.
- 11 października 2026 HappyHorse 1.1 jest 12. w rankingu tekstu na wideo (1042 Elo) i 8. w obrazie na wideo (1104 Elo).
Najmocniejszym rywalem jest Wan 3.0, też od Alibaby, ale z innego zespołu. Prowadzi w tekście na wideo z wynikiem 1156 i w polskiej scenie pomylił tylko 2 słowa. Pełne zestawienie: HappyHorse 1.1 vs Wan 3.0, Seedance i MiniMax.
Ile to kosztuje
- OpenRouter: 0,0988 USD za sekundę 720p, czyli 0,494 USD za mój klip 5 s; 1080p 0,1278 USD/s.
- Alibaba Cloud, region Frankfurt: 0,124 USD/s za 720P i 0,165 USD/s za 1080P.
- happyhorse.com: Standard 1 USD za pierwsze 7 dni, potem 10 USD miesięcznie.
Co to znaczy dla twórców rolek w Polsce
- Polskiego dialogu nie rób w HappyHorse 1.1. Co drugie słowo z błędem to za dużo na rolkę dla polskiego widza.
- Angielskie rolki - tak. Mowa i ruch ust są tu na dobrym poziomie.
- Polskie wersje rób z podkładem. Wygeneruj obraz bez dialogu, a głos nagraj osobno lub zrób lektorem AI i dołóż w montażu. Napisy też dodawaj w montażu.
- Do polskiej mowy wybierz inny model. W moich testach najlepiej wypadł MiniMax H3 Max, a z dźwiękiem z OpenRoutera - Wan 3.0.
Pozostałe moje klipy z tego modelu (orbita kamery, postać w dwóch ujęciach, obraz na wideo) są w tekście Co potrafi HappyHorse 1.1. Przegląd innych narzędzi: generatory wideo AI.
Źródła i data sprawdzenia
- Mój test: OpenRouter, alibaba/happyhorse-1.1, 11.10.2026; transkrypcja faster-whisper large-v3
- Arena wideo (8.10.2026, WER rywali z rundy 28.09.2026)
- Artificial Analysis, strona modelu (11.10.2026)
- Cennik Alibaba Cloud, OpenRouter, happyhorse.com (11.10.2026)
- CNBC (10.04.2026), blog Alibaba Cloud (23.06.2026)
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →