Gemini 3.5 Flash dostaje wbudowane sterowanie komputerem - agenty klikają same
Google DeepMind wbudowało funkcję computer use prosto w model Gemini 3.5 Flash, dając programistom narzędzie do budowy agentów działających w przeglądarce, na urządzeniach mobilnych i komputerach stacjonarnych.
👁 143 przeczytań
Model dostaje listę funkcji aplikacji Gemini i sam ją kategoryzuje. W innym przykładzie audytuje własną dokumentację pod kątem dostępności. Wszystko bez ludzkiej ręki na myszce - to nowe ogłoszenie Google DeepMind, które 24 czerwca 2026 roku pokazało, do czego służy świeżo wbudowana funkcja sterowania komputerem.
Computer use jest teraz natywnym narzędziem w modelu Gemini 3.5 Flash. Wcześniej była to osobna konstrukcja - samodzielny model Gemini 2.5 computer use. Teraz tę samą zdolność wszczepiono do głównego, szybkiego modelu Flash, który już wcześniej radził sobie z wywoływaniem funkcji i wbudowanymi narzędziami, takimi jak grounding w Search czy Maps.
Różnica jest praktyczna: programiści mogą budować agentów, którzy - jak ujmuje to Google - potrafią widzieć, rozumować i podejmować działania w środowiskach przeglądarki, urządzeń mobilnych i komputerów stacjonarnych. W praktyce oznacza to ciągłe testowanie oprogramowania, automatyzację w aplikacjach biznesowych i pracę umysłową rozłożoną na długie sekwencje kroków.
Agent, który klika, to agent, którego można oszukać
Im więcej swobody dostaje agent działający w żywym środowisku, tym większe ryzyko, że ktoś podsunie mu spreparowaną instrukcję ukrytą na stronie czy w dokumencie. To klasyczny prompt injection. Google twierdzi, że ogranicza to ryzyko poprzez ukierunkowany trening adwersarialny modelu.
Do tego dorzuca dwa opcjonalne zabezpieczenia dla firm. Pierwsze wymusza wyraźne potwierdzenie użytkownika przy wrażliwych lub nieodwracalnych akcjach. Drugie automatycznie zatrzymuje zadanie, jeśli system wykryje pośredni prompt injection.
DeepMind nazywa swoje podejście „defense-in-depth” i zachęca, by łączyć te funkcje z bezpiecznym sandboxingiem, weryfikacją z udziałem człowieka i ścisłą kontrolą dostępu. Innymi słowy: same wbudowane bariery to za mało, resztę musi dobudować ten, kto wdraża agenta.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Gdzie to przetestować
Funkcję można uruchomić od razu w środowisku demonstracyjnym hostowanym przez Browserbase, a wdrożenie produkcyjne odbywa się poprzez Gemini API oraz Gemini Enterprise Agent Platform. Google zaznacza, że klienci już czerpią z tego korzyści, choć w samym ogłoszeniu konkretne wypowiedzi firm zostały jedynie zapowiedziane.
To kolejny ruch w kierunku, w którym cała branża pcha się od ponad roku: model przestaje być rozmówcą, a staje się wykonawcą.
Wbudowanie computer use w szybki model Flash - zamiast trzymania go jako osobnej, cięższej konstrukcji - to sygnał, że Google chce zobaczyć tę funkcję w masie zwykłych wdrożeń, a nie w niszowych demonstracjach.
Pytanie nie brzmi już, czy agent kliknie za nas. Brzmi, czy zdążymy zauważyć, gdy kliknie nie tam.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


