🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

Gemini 3.5 Flash dostaje wbudowane sterowanie komputerem - agenty klikają same

Google DeepMind wbudowało funkcję computer use prosto w model Gemini 3.5 Flash, dając programistom narzędzie do budowy agentów działających w przeglądarce, na urządzeniach mobilnych i komputerach stacjonarnych.

2 min czytania
Ostatnia aktualizacja:
Gemini 3.5 Flash dostaje wbudowane sterowanie komputerem – agenty klikają same

👁 143 przeczytań

Model dostaje listę funkcji aplikacji Gemini i sam ją kategoryzuje. W innym przykładzie audytuje własną dokumentację pod kątem dostępności. Wszystko bez ludzkiej ręki na myszce - to nowe ogłoszenie Google DeepMind, które 24 czerwca 2026 roku pokazało, do czego służy świeżo wbudowana funkcja sterowania komputerem.

Computer use jest teraz natywnym narzędziem w modelu Gemini 3.5 Flash. Wcześniej była to osobna konstrukcja - samodzielny model Gemini 2.5 computer use. Teraz tę samą zdolność wszczepiono do głównego, szybkiego modelu Flash, który już wcześniej radził sobie z wywoływaniem funkcji i wbudowanymi narzędziami, takimi jak grounding w Search czy Maps.

Różnica jest praktyczna: programiści mogą budować agentów, którzy - jak ujmuje to Google - potrafią widzieć, rozumować i podejmować działania w środowiskach przeglądarki, urządzeń mobilnych i komputerów stacjonarnych. W praktyce oznacza to ciągłe testowanie oprogramowania, automatyzację w aplikacjach biznesowych i pracę umysłową rozłożoną na długie sekwencje kroków.

Agent, który klika, to agent, którego można oszukać

Im więcej swobody dostaje agent działający w żywym środowisku, tym większe ryzyko, że ktoś podsunie mu spreparowaną instrukcję ukrytą na stronie czy w dokumencie. To klasyczny prompt injection. Google twierdzi, że ogranicza to ryzyko poprzez ukierunkowany trening adwersarialny modelu.

Do tego dorzuca dwa opcjonalne zabezpieczenia dla firm. Pierwsze wymusza wyraźne potwierdzenie użytkownika przy wrażliwych lub nieodwracalnych akcjach. Drugie automatycznie zatrzymuje zadanie, jeśli system wykryje pośredni prompt injection.

DeepMind nazywa swoje podejście „defense-in-depth” i zachęca, by łączyć te funkcje z bezpiecznym sandboxingiem, weryfikacją z udziałem człowieka i ścisłą kontrolą dostępu. Innymi słowy: same wbudowane bariery to za mało, resztę musi dobudować ten, kto wdraża agenta.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Gdzie to przetestować

Funkcję można uruchomić od razu w środowisku demonstracyjnym hostowanym przez Browserbase, a wdrożenie produkcyjne odbywa się poprzez Gemini API oraz Gemini Enterprise Agent Platform. Google zaznacza, że klienci już czerpią z tego korzyści, choć w samym ogłoszeniu konkretne wypowiedzi firm zostały jedynie zapowiedziane.

To kolejny ruch w kierunku, w którym cała branża pcha się od ponad roku: model przestaje być rozmówcą, a staje się wykonawcą.

Wbudowanie computer use w szybki model Flash - zamiast trzymania go jako osobnej, cięższej konstrukcji - to sygnał, że Google chce zobaczyć tę funkcję w masie zwykłych wdrożeń, a nie w niszowych demonstracjach.

Pytanie nie brzmi już, czy agent kliknie za nas. Brzmi, czy zdążymy zauważyć, gdy kliknie nie tam.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie