Przejdź do treści
Newsy

Google DeepMind wydało Gemini 3.7 Flash - tańszy i skuteczniejszy model do kodowania i agentów

Google DeepMind wprowadził Gemini 3.7 Flash zaledwie trzy tygodnie po poprzedniej wersji, oferując znaczące skoki w benchmarkach kodowania i automatyzacji przy połowie wcześniejszej ceny.

4 min czytania
Google DeepMind wydał Gemini 3.7 Flash - tańszy i skuteczniejszy model do kodowania i agentów

👁 254 przeczytań

Google DeepMind ogłosił 13 sierpnia 2026 roku Gemini 3.7 Flash - nowy model z serii Flash, który pojawia się zaledwie trzy tygodnie po Gemini 3.6 Flash i przynosi wyraźne skoki w benchmarkach kodowania, automatyzacji i pracy z dokumentami, jednocześnie obniżając cenę o połowę. To dość rzadka kombinacja: lepszy model w niższej cenie, i to w tak krótkim oknie czasowym.

Co się zmieniło względem poprzednika

Liczby mówią same za siebie. Na benchmarku DeepSWE v1.1, który mierzy skuteczność w rozwiązywaniu rzeczywistych problemów inżynierskich w repozytoriach kodu, 3.7 Flash osiąga 65,3% wobec 49,0% dla 3.6 Flash - to wzrost o ponad 16 punktów procentowych. Na FrontierCode 1.1 Main, oceniającym poprawność kodu przy pierwszej próbie, wynik skoczył z 34,4% do 43,6%. W obu przypadkach mowa o benchmarkach, które branża traktuje jako wiarygodne proxy dla rzeczywistej przydatności modeli w pracy programistycznej.

W tworzeniu interfejsów webowych model uzyskał Elo score 1588 na Arena.ai’s WebDev Arena wobec 1538 dla poprzednika. Brzmi skromnie, ale w rankingach Elo różnica kilkudziesięciu punktów przy tej skali oznacza wyraźnie lepsze wyniki w bezpośrednich porównaniach. Dla deweloperów budujących aplikacje webowe przekłada się to na więcej funkcjonalnych layoutów generowanych w mniejszej liczbie promptów i lepsze odwzorowanie systemów projektowania - czy to ze screenshota, obrazu, czy pełnego design systemu.

Jeszcze ciekawsze zmiany dotyczą pracy z dokumentami i automatyzacji procesów biznesowych. Na benchmarku GDP.pdf, testującym zdolność do przetwarzania złożonych dokumentów - takich jak wielostronicowe raporty finansowe czy umowy prawne - 3.7 Flash osiąga 34,0% wobec 22,0% dla 3.6 Flash. To wzrost o 12 punktów, który w praktyce może oznaczać różnicę między modelem, który gubi się w skomplikowanej tabeli przypisów, a takim, który wyciąga z niej właściwe dane. W AutomationBench, mierzącym skuteczność w wykonywaniu rzeczywistych workflows biznesowych, wynik skoczył z 17,0% do 30,4% - niemal dwukrotny wzrost.

Cena jako argument strategiczny

Gemini 3.7 Flash jest dostępny do końca roku w cenie introductory: $0,75 za milion tokenów wejściowych i $3,75 za milion tokenów wyjściowych. To połowa tego, co kosztował 3.6 Flash w momencie premiery. Zestawienie lepszej wydajności z niższą ceną to klasyczny ruch, który Google stosuje w segmencie Flash - modelach przeznaczonych do masowego wdrożenia w agentach i pipeline’ach produkcyjnych, gdzie koszt inferowania ma bezpośrednie przełożenie na opłacalność całego rozwiązania.

Dla kontekstu: Flash to seria, którą Google pozycjonuje jako tzw. workhorse models - nie najinteligentniejsze modele w portfolio (tym jest Gemini Ultra czy linia Pro), ale wystarczająco dobre do szerokiej klasy zadań i wystarczająco tanie, żeby uruchamiać je setki milionów razy dziennie w aplikacjach produkcyjnych. Model obsługujący agenta do analizy dokumentów prawnych może przetworzyć ich tysiące dziennie - przy stawce $0,75/1M tokenów różnica względem droższego modelu szybko przekłada się na budżet.

Trzy tygodnie to mało - albo bardzo dużo

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Fakt, że 3.7 Flash pojawił się trzy tygodnie po 3.6 Flash, jest sam w sobie wart uwagi. Tulsee Doshi, Senior Director of Product Management w zespole Gemini, napisała w komunikacie, że premiera jest bezpośrednim wynikiem opinii deweloperów i innowacji algorytmicznych, które Google zamierza przenosić do kolejnych modeli. To sugeruje, że mamy do czynienia nie tyle z planowanym releaseowym harmonogramem, ile z pipeline’em ciągłego doskonalenia - zbierania feedbacku ze środowiska produkcyjnego i szybkiego iterowania.

Dla deweloperów budujących na Gemini API taki rytm wydań ma konkretne konsekwencje. Z jednej strony - dostają narzędzie szybciej dosuwane do realnych potrzeb. Z drugiej - zarządzanie wersjami w aplikacjach produkcyjnych staje się wyzwaniem: testowanie nowych modeli, weryfikacja regresji i decyzja o migracji pochłaniają czas. To napięcie między szybkością innowacji a stabilnością, które zna każdy, kto kiedykolwiek utrzymywał system zależny od zewnętrznego API.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co to zmienia dla agentów AI

Największy potencjał 3.7 Flash tkwi właśnie w zastosowaniach agentowych. Google wprost opisuje model jako przeznaczony do kodowania i agentów - i rzeczywiście zmiany w zachowaniu modelu sugerują, że był optymalizowany pod ten przypadek użycia. Według komunikatu DeepMind model lepiej adaptuje się do napotkanych przeszkód, doprecyzowuje intencje użytkownika gdy zajdzie taka potrzeba i wykonuje instrukcje z większą dokładnością. Myśli bardziej metodycznie w wielostopniowym planowaniu i przy wywołaniach narzędzi. Mniej ręcznego nadzoru i mniej ponownych prób - to konkretna obietnica dla architektów systemów agentowych.

Przykłady demonstracyjne opublikowane przez Google są wymowne: model steruje sub-agentami przy budowie interaktywnych stron z paralaksą, wspomaga trening modelu robotycznego w pętli trzech agentów, generuje gry 3D z dynamicznie tworzonych zasobów. To nie są przykłady modelu-asystenta odpowiadającego na pytania - to model działający jako koordynator złożonych, wieloetapowych procesów.

Przy takim tempie iteracji i takiej trajektorii cenowej seria Flash staje się coraz trudniejszą propozycją do zignorowania dla każdego, kto projektuje dziś systemy oparte na AI - niezależnie od tego, czy robi to w Polsce, Europie czy gdziekolwiek indziej.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie