Google DeepMind wydało Gemini 3.7 Flash - tańszy i skuteczniejszy model do kodowania i agentów
Google DeepMind wprowadził Gemini 3.7 Flash zaledwie trzy tygodnie po poprzedniej wersji, oferując znaczące skoki w benchmarkach kodowania i automatyzacji przy połowie wcześniejszej ceny.

👁 254 przeczytań
Google DeepMind ogłosił 13 sierpnia 2026 roku Gemini 3.7 Flash - nowy model z serii Flash, który pojawia się zaledwie trzy tygodnie po Gemini 3.6 Flash i przynosi wyraźne skoki w benchmarkach kodowania, automatyzacji i pracy z dokumentami, jednocześnie obniżając cenę o połowę. To dość rzadka kombinacja: lepszy model w niższej cenie, i to w tak krótkim oknie czasowym.
Co się zmieniło względem poprzednika
Liczby mówią same za siebie. Na benchmarku DeepSWE v1.1, który mierzy skuteczność w rozwiązywaniu rzeczywistych problemów inżynierskich w repozytoriach kodu, 3.7 Flash osiąga 65,3% wobec 49,0% dla 3.6 Flash - to wzrost o ponad 16 punktów procentowych. Na FrontierCode 1.1 Main, oceniającym poprawność kodu przy pierwszej próbie, wynik skoczył z 34,4% do 43,6%. W obu przypadkach mowa o benchmarkach, które branża traktuje jako wiarygodne proxy dla rzeczywistej przydatności modeli w pracy programistycznej.
W tworzeniu interfejsów webowych model uzyskał Elo score 1588 na Arena.ai’s WebDev Arena wobec 1538 dla poprzednika. Brzmi skromnie, ale w rankingach Elo różnica kilkudziesięciu punktów przy tej skali oznacza wyraźnie lepsze wyniki w bezpośrednich porównaniach. Dla deweloperów budujących aplikacje webowe przekłada się to na więcej funkcjonalnych layoutów generowanych w mniejszej liczbie promptów i lepsze odwzorowanie systemów projektowania - czy to ze screenshota, obrazu, czy pełnego design systemu.
Jeszcze ciekawsze zmiany dotyczą pracy z dokumentami i automatyzacji procesów biznesowych. Na benchmarku GDP.pdf, testującym zdolność do przetwarzania złożonych dokumentów - takich jak wielostronicowe raporty finansowe czy umowy prawne - 3.7 Flash osiąga 34,0% wobec 22,0% dla 3.6 Flash. To wzrost o 12 punktów, który w praktyce może oznaczać różnicę między modelem, który gubi się w skomplikowanej tabeli przypisów, a takim, który wyciąga z niej właściwe dane. W AutomationBench, mierzącym skuteczność w wykonywaniu rzeczywistych workflows biznesowych, wynik skoczył z 17,0% do 30,4% - niemal dwukrotny wzrost.
Cena jako argument strategiczny
Gemini 3.7 Flash jest dostępny do końca roku w cenie introductory: $0,75 za milion tokenów wejściowych i $3,75 za milion tokenów wyjściowych. To połowa tego, co kosztował 3.6 Flash w momencie premiery. Zestawienie lepszej wydajności z niższą ceną to klasyczny ruch, który Google stosuje w segmencie Flash - modelach przeznaczonych do masowego wdrożenia w agentach i pipeline’ach produkcyjnych, gdzie koszt inferowania ma bezpośrednie przełożenie na opłacalność całego rozwiązania.
Dla kontekstu: Flash to seria, którą Google pozycjonuje jako tzw. workhorse models - nie najinteligentniejsze modele w portfolio (tym jest Gemini Ultra czy linia Pro), ale wystarczająco dobre do szerokiej klasy zadań i wystarczająco tanie, żeby uruchamiać je setki milionów razy dziennie w aplikacjach produkcyjnych. Model obsługujący agenta do analizy dokumentów prawnych może przetworzyć ich tysiące dziennie - przy stawce $0,75/1M tokenów różnica względem droższego modelu szybko przekłada się na budżet.
Trzy tygodnie to mało - albo bardzo dużo
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Fakt, że 3.7 Flash pojawił się trzy tygodnie po 3.6 Flash, jest sam w sobie wart uwagi. Tulsee Doshi, Senior Director of Product Management w zespole Gemini, napisała w komunikacie, że premiera jest bezpośrednim wynikiem opinii deweloperów i innowacji algorytmicznych, które Google zamierza przenosić do kolejnych modeli. To sugeruje, że mamy do czynienia nie tyle z planowanym releaseowym harmonogramem, ile z pipeline’em ciągłego doskonalenia - zbierania feedbacku ze środowiska produkcyjnego i szybkiego iterowania.
Dla deweloperów budujących na Gemini API taki rytm wydań ma konkretne konsekwencje. Z jednej strony - dostają narzędzie szybciej dosuwane do realnych potrzeb. Z drugiej - zarządzanie wersjami w aplikacjach produkcyjnych staje się wyzwaniem: testowanie nowych modeli, weryfikacja regresji i decyzja o migracji pochłaniają czas. To napięcie między szybkością innowacji a stabilnością, które zna każdy, kto kiedykolwiek utrzymywał system zależny od zewnętrznego API.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co to zmienia dla agentów AI
Największy potencjał 3.7 Flash tkwi właśnie w zastosowaniach agentowych. Google wprost opisuje model jako przeznaczony do kodowania i agentów - i rzeczywiście zmiany w zachowaniu modelu sugerują, że był optymalizowany pod ten przypadek użycia. Według komunikatu DeepMind model lepiej adaptuje się do napotkanych przeszkód, doprecyzowuje intencje użytkownika gdy zajdzie taka potrzeba i wykonuje instrukcje z większą dokładnością. Myśli bardziej metodycznie w wielostopniowym planowaniu i przy wywołaniach narzędzi. Mniej ręcznego nadzoru i mniej ponownych prób - to konkretna obietnica dla architektów systemów agentowych.
Przykłady demonstracyjne opublikowane przez Google są wymowne: model steruje sub-agentami przy budowie interaktywnych stron z paralaksą, wspomaga trening modelu robotycznego w pętli trzech agentów, generuje gry 3D z dynamicznie tworzonych zasobów. To nie są przykłady modelu-asystenta odpowiadającego na pytania - to model działający jako koordynator złożonych, wieloetapowych procesów.
Przy takim tempie iteracji i takiej trajektorii cenowej seria Flash staje się coraz trudniejszą propozycją do zignorowania dla każdego, kto projektuje dziś systemy oparte na AI - niezależnie od tego, czy robi to w Polsce, Europie czy gdziekolwiek indziej.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


