VPS: model przeszukuje obrazy wysokiej rozdzielczości równolegle, nie po kolei
Modele multimodalne często nie radzą sobie z pytaniami o szczegóły na dużych obrazach, bo muszą zgadywać, gdzie zajrzeć, zanim cokolwiek zobaczą. VPS rozwiązuje to inaczej - najpierw sprawdza wiele fragmentów jednocześnie, a dopiero potem powiększa wybrane miejsce.

👁 118 przeczytań
Praca pochodzi z arXiv (cs.CV, cs.AI), zgłoszona 29 września 2026 roku. Autorami są członkowie ośmioosobowego zespołu: Xijia Tao, Yihua Teng, Xinyu Fu, Cheng Gong, Ziru Liu, Xudong Xie, Rui Liu i Lingpeng Kong.
Na czym polega problem
Modele multimodalne (takie, które rozumieją jednocześnie tekst i obraz) mają kłopot z obrazami o wysokiej rozdzielczości. Żeby odpowiedzieć na pytanie dotyczące małego, dobrze zlokalizowanego fragmentu zdjęcia, model musi najpierw wybrać, gdzie zajrzeć - a robi to zanim zdąży zobaczyć całość. Autorzy nazywają to podejście „sekwencyjnym zoomem” i wskazują, że właśnie ten porządek działania jest źródłem błędów.
Co proponują autorzy
Rozwiązanie nosi nazwę VPS (Visual Parallel Search). Działa dwuetapowo. Najpierw główny agent wywołuje funkcję grid_search, która dzieli obraz na kafelki i wysyła każdy z nich do osobnego sub-agenta. Sub-agenty działają równolegle i są uwarunkowane zadanym pytaniem - czyli szukają konkretnej odpowiedzi, nie przeszukują obrazu w ciemno. Dopiero po zebraniu wyników z tego równoległego przeglądu główny agent może wywołać funkcję zoom_in i powiększyć wybrany fragment. Dzięki temu decyzja o powiększeniu jest podejmowana na podstawie realnych danych, a nie przypuszczeń.
Wyniki na benchmarkach
Autorzy porównują VPS z podejściem opartym wyłącznie na zoomie. Na tym samym modelu bazowym VPS wypada lepiej w 14 z 15 porównań, a maksymalny zysk wynosi 8,0 punktu procentowego dokładności. Szczególnie duże poprawy odnotowano dla mniejszych modeli głównych. Na benchmarku ZoomBench VPS utrzymuje przewagę około 3,2 punktu niezależnie od testowanego rozmiaru modelu.
Uczenie się ról: SFT i RL
Oprócz samego frameworku autorzy opracowali też pipeline do trenowania modelu. Zawiera on weryfikację bez podpowiedzi (hint-free verification) oraz sparowany, rolowo-specyficzny wariant GRPO jako cel uczenia dla dwóch ról: kontrolera (główny agent) i czytnika kafelków (sub-agent).
Fine-tuning nadzorowany (SFT) poprawia dokładność na wszystkich pięciu podziałach benchmarków testowych, w tym o 4,17 punktu na HR-Bench 4K.
Reinforcement learning (RL) zmienia już zachowanie modelu w bardziej złożony sposób. RL trenowany tylko na roli głównego agenta redukuje średnie użycie narzędzi z 2,65 do 2,11 przy podobnym wyniku pass@1 w wewnętrznej ewaluacji na czterech odpowiedziach. Autorzy zaznaczają jednak, że zmiany w zewnętrznej dokładności są mieszane. Wspólny trening obu ról ujawnił asymetrię między czytaniem lokalnych dowodów a globalnym sterowaniem wyszukiwaniem - dokument nie wyjaśnia tej asymetrii szerzej poza tym stwierdzeniem.
Czego w dokumencie nie ma
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Abstrakt nie podaje, na jakich konkretnych modelach bazowych przeprowadzono eksperymenty, nie wymienia też nazw wszystkich 15 porównań składających się na zestawienie wyników. Szczegóły architektury sub-agentów, dane treningowe ani koszty obliczeniowe nie są omówione w dostępnym fragmencie.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
VPS to propozycja zmiany kolejności operacji przy pracy z dużymi obrazami - zamiast zgadywać i potem sprawdzać, model najpierw zbiera dowody równolegle, a dopiero potem decyduje. Liczby są konkretne i spójne: 8 punktów maksymalnego zysku i stabilne 3,2 punktu na ZoomBench to wyniki, które trudno zignorować. Niepokojący jest fragment o RL - autorzy sami przyznają, że zewnętrzna dokładność po treningu RL jest „mieszana”, co sugeruje, że uczenie zachowania agenta w tym frameworku nie jest jeszcze dopracowane. Jeśli VPS faktycznie działa lepiej dla mniejszych modeli, może to być ciekawa ścieżka dla zastosowań, gdzie nie ma budżetu na duże modele, ale jest potrzeba analizy szczegółowych zdjęć - dokumentów, map, zdjęć satelitarnych czy medycznych.
Źródło: arXiv cs.AI: Visual Parallel Search: Learning to Search High-Resolution Images with Parallel Tile Inspection and Adaptive Zoom (dokument z 2026-09-30). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
