-10% na wszystko w kinetyka.pltylko dziś, do 23:59•PIZZASZWECJA• plany AI: Cursor, Gemini, Higgsfield w ułamku ceny Odbierz rabatkinetyka.pl →
Przejdź do treści
Newsy

VPS: model przeszukuje obrazy wysokiej rozdzielczości równolegle, nie po kolei

Modele multimodalne często nie radzą sobie z pytaniami o szczegóły na dużych obrazach, bo muszą zgadywać, gdzie zajrzeć, zanim cokolwiek zobaczą. VPS rozwiązuje to inaczej - najpierw sprawdza wiele fragmentów jednocześnie, a dopiero potem powiększa wybrane miejsce.

3 min czytania
VPS: model przeszukuje obrazy wysokiej rozdzielczości równolegle, nie po kolei

👁 118 przeczytań

Praca pochodzi z arXiv (cs.CV, cs.AI), zgłoszona 29 września 2026 roku. Autorami są członkowie ośmioosobowego zespołu: Xijia Tao, Yihua Teng, Xinyu Fu, Cheng Gong, Ziru Liu, Xudong Xie, Rui Liu i Lingpeng Kong.

Na czym polega problem

Modele multimodalne (takie, które rozumieją jednocześnie tekst i obraz) mają kłopot z obrazami o wysokiej rozdzielczości. Żeby odpowiedzieć na pytanie dotyczące małego, dobrze zlokalizowanego fragmentu zdjęcia, model musi najpierw wybrać, gdzie zajrzeć - a robi to zanim zdąży zobaczyć całość. Autorzy nazywają to podejście „sekwencyjnym zoomem” i wskazują, że właśnie ten porządek działania jest źródłem błędów.

Co proponują autorzy

Rozwiązanie nosi nazwę VPS (Visual Parallel Search). Działa dwuetapowo. Najpierw główny agent wywołuje funkcję grid_search, która dzieli obraz na kafelki i wysyła każdy z nich do osobnego sub-agenta. Sub-agenty działają równolegle i są uwarunkowane zadanym pytaniem - czyli szukają konkretnej odpowiedzi, nie przeszukują obrazu w ciemno. Dopiero po zebraniu wyników z tego równoległego przeglądu główny agent może wywołać funkcję zoom_in i powiększyć wybrany fragment. Dzięki temu decyzja o powiększeniu jest podejmowana na podstawie realnych danych, a nie przypuszczeń.

Wyniki na benchmarkach

Autorzy porównują VPS z podejściem opartym wyłącznie na zoomie. Na tym samym modelu bazowym VPS wypada lepiej w 14 z 15 porównań, a maksymalny zysk wynosi 8,0 punktu procentowego dokładności. Szczególnie duże poprawy odnotowano dla mniejszych modeli głównych. Na benchmarku ZoomBench VPS utrzymuje przewagę około 3,2 punktu niezależnie od testowanego rozmiaru modelu.

Uczenie się ról: SFT i RL

Oprócz samego frameworku autorzy opracowali też pipeline do trenowania modelu. Zawiera on weryfikację bez podpowiedzi (hint-free verification) oraz sparowany, rolowo-specyficzny wariant GRPO jako cel uczenia dla dwóch ról: kontrolera (główny agent) i czytnika kafelków (sub-agent).

Fine-tuning nadzorowany (SFT) poprawia dokładność na wszystkich pięciu podziałach benchmarków testowych, w tym o 4,17 punktu na HR-Bench 4K.

Reinforcement learning (RL) zmienia już zachowanie modelu w bardziej złożony sposób. RL trenowany tylko na roli głównego agenta redukuje średnie użycie narzędzi z 2,65 do 2,11 przy podobnym wyniku pass@1 w wewnętrznej ewaluacji na czterech odpowiedziach. Autorzy zaznaczają jednak, że zmiany w zewnętrznej dokładności są mieszane. Wspólny trening obu ról ujawnił asymetrię między czytaniem lokalnych dowodów a globalnym sterowaniem wyszukiwaniem - dokument nie wyjaśnia tej asymetrii szerzej poza tym stwierdzeniem.

Czego w dokumencie nie ma

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Abstrakt nie podaje, na jakich konkretnych modelach bazowych przeprowadzono eksperymenty, nie wymienia też nazw wszystkich 15 porównań składających się na zestawienie wyników. Szczegóły architektury sub-agentów, dane treningowe ani koszty obliczeniowe nie są omówione w dostępnym fragmencie.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Co z tego wynika

VPS to propozycja zmiany kolejności operacji przy pracy z dużymi obrazami - zamiast zgadywać i potem sprawdzać, model najpierw zbiera dowody równolegle, a dopiero potem decyduje. Liczby są konkretne i spójne: 8 punktów maksymalnego zysku i stabilne 3,2 punktu na ZoomBench to wyniki, które trudno zignorować. Niepokojący jest fragment o RL - autorzy sami przyznają, że zewnętrzna dokładność po treningu RL jest „mieszana”, co sugeruje, że uczenie zachowania agenta w tym frameworku nie jest jeszcze dopracowane. Jeśli VPS faktycznie działa lepiej dla mniejszych modeli, może to być ciekawa ścieżka dla zastosowań, gdzie nie ma budżetu na duże modele, ale jest potrzeba analizy szczegółowych zdjęć - dokumentów, map, zdjęć satelitarnych czy medycznych.

Źródło: arXiv cs.AI: Visual Parallel Search: Learning to Search High-Resolution Images with Parallel Tile Inspection and Adaptive Zoom (dokument z 2026-09-30). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›