Przejdź do treści
Warsztat

DeepSeek V4.1 Flash: nowa architektura, koniec V4 Pro i mój test po polsku

Od 14 września zapytania do V4 Pro trafiają do nowego Flasha. Najostrożniejszy model w moim teście - poza jednym zmyślonym szczegółem.

6 min czytania
DeepSeek V4.1 Flash: nowa architektura, koniec V4 Pro i mój test po polsku

👁 122 przeczytań

// w skrócie
  • DeepSeek V4.1 Flash zastąpił V4 Pro od 14 września 2026 - zapytania do starego modelu trafiają automatycznie do nowego.
  • Model kosztuje 0,14 USD za milion tokenów wejścia i 0,42 USD za wyjście, a trzy zadania testowe zamknął łącznie za 0,008 USD.
  • Architektura rozdziela czytanie i pisanie: enkoder używa 8 mld aktywnych parametrów, dekoder 16 mld, co zmniejsza koszt przetwarzania długich kontekstów.

10 września 2026 DeepSeek wypuścił DeepSeek V4.1 Flash - i po cichu zrobił z niego swój jedyny model. Cztery dni później zapytania wysyłane do V4 Pro zaczęły trafiać do V4.1 Flash. Nowy model ma architekturę, której nie miał dotąd żaden duży model językowy: osobny enkoder do czytania i dekoder do pisania. Sprawdziłem go na tych samych zadaniach co Claude Opus 5.5 i GPT-6 - i złapałem go na zmyślonym szczególe, jakiego nie spodziewałem się po tak ostrożnym modelu.

Werdykt w jednym akapicie

DeepSeek V4.1 Flash jest najostrożniejszym modelem, jaki testowałem w tym miesiącu: w tekście po polsku napisał „nie wiem” 14 razy, nie podał żadnej nieprawdziwej liczby, a jedyną twardą daną (inflacja 11,4% w 2023 roku według GUS) podał poprawnie. Kosztuje 0,14 i 0,42 USD za milion tokenów, a trzy moje zadania zamknął za 0,008 USD. Dwa minusy: tekst po polsku pisał ponad 5 minut i wymyślił sobie „rozmowy ze znajomymi z branży”, na których rzekomo oparł opinię.

Najważniejsze fakty

ParametrDeepSeek V4.1 Flash
Premiera10 września 2026
Parametry552 mld w szkielecie MoE, 8 mld aktywnych przy czytaniu, 16 mld przy pisaniu
Kontekstdo 1 mln tokenów
Wejścietekst i obraz - pierwszy natywnie multimodalny model DeepSeek
LicencjaMIT, wagi na Hugging Face
Cena na OpenRouterze0,14 USD wejście / 0,42 USD wyjście za milion tokenów
Poza godzinami szczytuw API DeepSeek 50% stawki szczytowej
Nazwa w API DeepSeekdeepseek-flash
Poziom rozumowaniaregulowany płynnie liczbą od 1 do 100

Koniec V4 Pro - co to znaczy dla Ciebie

Najważniejsza informacja z ogłoszenia jest na samym dole: V4 Flash i V4 Flash Vision zostały wycofane, a V4 Pro jest wygaszany - od 14 września zapytania kierowane do niego trafiają do V4.1 Flash. Jeśli masz aplikację na API DeepSeek i nie zmieniałeś nazwy modelu, od 14 września rozmawiasz już z nowym modelem.

Co sprawdzić:

  • Długość odpowiedzi i czas. W moim teście V4.1 Flash pisał tekst po polsku 316 sekund, z czego większość zajęło myślenie (5226 z 7046 tokenów wyjścia).
  • Format odpowiedzi. Zagadkę rozwiązał, zwracając sam wynik w 7 znakach - bez żadnego uzasadnienia. Jeśli Twój kod oczekiwał opisu, może go nie dostać.
  • Rachunek. Przy tej stawce spadnie wobec V4 Pro, ale myślenie liczy się jak wyjście.

Enkoder i dekoder - na czym polega zmiana

Od GPT-2 praktycznie wszystkie duże modele językowe to same dekodery: ta sama maszyneria czyta Twoje polecenie i pisze odpowiedź. DeepSeek rozdzielił te role. Model ma 40 warstw: 20 warstw enkodera czyta wejście, 20 warstw dekodera pisze odpowiedź. Przy czytaniu pracuje 8 mld parametrów, przy pisaniu 16 mld.

Po co? Agent programistyczny czyta tysiące linii kodu i wyników narzędzi, a pisze krótką poprawkę. Czytanie dominuje w rachunku, więc DeepSeek zrobił je tańszym. Efekt uboczny: pamięć podręczna rozmowy zajmuje około 890 bajtów na token - mniej więcej czwartą część tego, co w V4 Flash, a trwały zapis tej pamięci na dysku spadł do 1/8.

To jest moja opinia: dla zwykłego użytkownika czatu ta zmiana jest niewidoczna. Dla firm, które płacą za długie konteksty agentów, to może być najważniejsza nowość architektoniczna tego roku - pod warunkiem, że wyniki potwierdzą się poza tabelą producenta.

Benchmarki producenta

TestV4.1 FlashV4 FlashV4 Pro
MMLU-Pro74,168,373,5
HumanEval79,469,576,8
GSM8K93,090,892,6
BigCodeBench60,656,859,2
DeepSWE v1.174,254,462,7
Terminal-Bench 2.190,682,787,9

Nowy Flash wygrywa ze starym Pro we wszystkich sześciu testach, największą różnicą w DeepSWE: 74,2 wobec 62,7. To wyjaśnia, dlaczego DeepSeek mógł wygasić Pro bez straty. Zastrzeżenie: DeepSeek porównuje się tylko z własnymi modelami, bez Claude’a, GPT-6 czy Qwena.

Moje testy

Te same trzy zadania, które puściłem na Claude Opus 5.5 i GPT-6. OpenRouter, ustawienia domyślne.

ZadanieWynikKosztCzas
Tekst po polsku, 900 słów842 słowa, zero złamanych zakazów, 14 × „nie wiem”0,0043 USD316 s
Pułapka na zmyślanie liczb3 z 4 odmów + scenariusz prognozy z zastrzeżeniem0,0030 USD33 s
Zagadka z 13 warunkamipoprawnie, sam wynik bez uzasadnienia0,0009 USD13 s

Tekst po polsku: najostrożniejszy - i jeden zmyślony szczegół

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

90 zdań, z czego 32 oznaczone jako opinia i 14 z frazą „nie wiem”. Model wprost napisał, że liczbę 400 tysięcy pracujących w ICT słyszał, ale nie wie, czy jest prawdziwa - i dobrze, bo według Eurostatu w 2023 roku było ich 744 tysiące. Jedyną twardą liczbę, inflację 11,4% w 2023 roku według GUS, podał poprawnie.

Ale w drugim akapicie jest zdanie: „To opinia oparta na rozmowach ze znajomymi z branży.” Model nie ma znajomych i z nikim nie rozmawiał. To zmyślone doświadczenie - drobne, ale groźniejsze od zmyślonej liczby, bo czytelnik nie ma jak go sprawdzić. Jeśli publikujesz teksty z AI, takie zdania trzeba wyłapywać ręcznie.

Pułapka na zmyślanie: jak GPT-6 Sol

Zysku, marży i rotacji kierowców nie podał. Przy prognozie policzył mechanicznie 51,7 mln zł i od razu dopisał, że to nie jest prognoza zatwierdzona ani oparta na danych o sezonowości. Tak samo zrobiły GPT-6 Sol, Qwen3.8 Max Prime i GLM-5.3 Prime. Policzył też przychód na przesyłkę (15,55 zł), którego nie podały ani GPT-6 Sol, ani Luna.

Zagadka: 7 znaków

Polecenie mówiło, że ostatnia linia ma zawierać sam ciąg liter. DeepSeek zwrócił wyłącznie „ADFCBGE” - cała odpowiedź miała 7 znaków, a całe rozumowanie (1422 tokeny) zostało w myśleniu. Poprawnie i tanio (0,0009 USD), ale bez śladu, skąd wynik.

Na tle innych chińskich premier

V4.1 Flash jako jedyny z pięciu chińskich modeli, które testowałem, napisał tekst po polsku na ustawieniach domyślnych bez złamanej reguły. MiMo-V2.6 Pro, Qwen3.8 Max Prime i GLM-5.3 Prime utknęły w myśleniu, a MiMo-V2.6 Flash użył zakazanego „Podsumowując”. Pełne porównanie pięciu modeli.

Najczęstsze pytania

Kiedy wyszedł DeepSeek V4.1 Flash?

10 września 2026. Wagi są na Hugging Face na licencji MIT.

Czy DeepSeek V4 Pro jeszcze działa?

Jest wygaszany. Od 14 września 2026 zapytania do V4 Pro trafiają do V4.1 Flash. V4 Flash i V4 Flash Vision są już wycofane.

Ile kosztuje DeepSeek V4.1 Flash?

Na OpenRouterze 0,14 USD za milion tokenów wejścia i 0,42 USD za milion wyjścia. W API DeepSeek poza godzinami szczytu stawka spada o połowę.

Czym jest architektura Causal Encoder-Decoder?

Podziałem modelu na część czytającą (enkoder, 8 mld aktywnych parametrów) i piszącą (dekoder, 16 mld). Czytanie długich kontekstów kosztuje dzięki temu mniej obliczeń.

Czy DeepSeek V4.1 Flash dobrze pisze po polsku?

Poprawnie i ostrożnie - w moim teście bez złamanych reguł i bez błędnych liczb. Pisał jednak ponad 5 minut i dopisał sobie zmyślone „rozmowy ze znajomymi”.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Źródła i data sprawdzenia

Data premiery, architektura, wycofanie V4 Flash i wygaszenie V4 Pro, nazwa w API i zasada stawek poza szczytem - z ogłoszenia deepseek.com. Licencja, liczba parametrów, kontekst, poziomy rozumowania i tabela benchmarków - z karty modelu na Hugging Face. Rozmiar pamięci podręcznej na token z raportu technicznego opisanego na arXiv. Stawki z listy modeli OpenRoutera. Wszystko odczytane 24 września 2026. Liczba specjalistów ICT z danych Eurostatu. Wyniki w sekcji „Moje testy” to moje pomiary: po jednym zapytaniu przez OpenRouter na ustawieniach domyślnych, koszt z pola rozliczeniowego odpowiedzi.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Kiedy DeepSeek V4.1 Flash został wydany i czy zastąpił poprzedni model?

DeepSeek V4.1 Flash wyszedł 10 września 2026. Od 14 września 2026 zapytania kierowane do V4 Pro trafiają do V4.1 Flash, a V4 Flash i V4 Flash Vision zostały już całkowicie wycofane.

Ile kosztuje DeepSeek V4.1 Flash na OpenRouterze?

Na OpenRouterze model kosztuje 0,14 USD za milion tokenów wejścia i 0,42 USD za milion tokenów wyjścia. W API DeepSeek poza godzinami szczytu stawka spada o połowę.

Na czym polega nowa architektura DeepSeek V4.1 Flash z enkoderem i dekoderem?

Model ma 40 warstw podzielonych na dwa bloki: 20 warstw enkodera czyta wejście przy użyciu 8 mld aktywnych parametrów, a 20 warstw dekodera pisze odpowiedź przy 16 mld. Dzięki temu czytanie długich kontekstów kosztuje mniej obliczeń niż w modelach opartych wyłącznie na dekoderze.

Czy DeepSeek V4.1 Flash dobrze pisze po polsku i jakie ma błędy?

W teście model napisał tekst bez złamanych reguł i bez błędnych liczb, używając frazy 'nie wiem' 14 razy, ale generowanie trwało ponad 5 minut. Jednocześnie dopisał sobie zmyślone 'rozmowy ze znajomymi z branży', co jest trudne do zweryfikowania przez czytelnika.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie