Canopy: algorytm banditowy dla LLM, który uczy się gdzie drzewo jest gładkie
Badacze Michael Jerge i Suman Jana proponują metodę CANOPY, która optymalizuje wiele problemów związanych z inferencją modeli językowych - od routingu po przycinanie promptów. Zamiast zakładać z góry, że przestrzeń rozwiązań jest wszędzie równomiernie gładka, algorytm sam wykrywa, gdzie to założenie nie działa.

👁 119 przeczytań
Praca pochodzi z arXiv (zgłoszona 24 września 2026) i dotyczy kategorii uczenia maszynowego. Autorzy to Michael Jerge oraz Suman Jana.
Problem: drzewo jako model inferencji LLM
Autorzy wychodzą od obserwacji, że wiele zadań związanych z inferencją dużych modeli językowych da się przedstawić jako optymalizację po drzewie. Konkretnie wymieniają: routing modeli, zarządzanie pamięcią podręczną prefiksów (prefix-cache management), przycinanie promptów (prompt trimming) oraz przeszukiwanie w czasie inferencji (test-time search). Struktura drzewiasta wynika wprost z autoregresywnego generowania tekstu - każdy prefiks definiuje węzeł, a jego możliwe kontynuacje tworzą poddrzewo poniżej.
W takim drzewie węzły wewnętrzne dają tanie, ale obciążone błędem oszacowania wartości danego regionu. Liście dają dokładną ocenę, ale są kosztowne obliczeniowo. Istnieją już hierarchiczne metody banditowe, które wykorzystują tę strukturę, ale wymagają z góry zdefiniowanego harmonogramu gładkości (smoothness schedule). Problem w tym, że realne funkcje celu są często tylko kawałkami gładkie, a ich optimum może leżeć blisko ostrej granicy.
Rozwiązanie: CANOPY
Zaproponowany algorytm CANOPY to wielorozdzielczy (multi-fidelity) bandit drzewiasty, który zamiast globalnie zakładać gładkość - uczy się, gdzie to założenie jest trafne. Mechanizm działa w dwóch krokach: najpierw tanie losowe próbkowanie ścieżek (random-path probes) buduje tzw. certyfikat lokalnej biasowości agregacji (certificate of local aggregation bias). Następnie drogie ewaluacje liści kierowane są właśnie tam, gdzie certyfikat wykrywa naruszenie założenia o gładkości.
Autorzy dowodzą gwarancji zarówno dla stałego budżetu (fixed-budget), jak i dla żalu (regret). Dodatkowy koszt wynikający z wykrywania nieciągłości jest addytywny względem liczby tych nieciągłości. Gdy nieciągłości nie ma, algorytm odzyskuje tempo charakterystyczne dla gładkiego drzewa. Gdy nieciągłości są gęste, zachowuje się jak przeszukiwanie bez wiedzy o strukturze.
Wyniki eksperymentalne
Autorzy testowali CANOPY na kilku zadaniach: routing modeli, identyfikacja top-k, przeszukiwanie w czasie inferencji, cachowanie oraz przycinanie promptów. We wszystkich przypadkach CANOPY poprawia wyniki przy tym samym budżecie obliczeniowym. Konkretne liczby podane w abstrakcie:
- 2,9-krotnie wyższy recall w top-10 na puli 1000 modeli,
- 1,6-krotnie więcej rozwiązanych zadań SWE-bench Verified w porównaniu do best-of-N,
- 3,6-krotnie niższy medianowy czas do pierwszego tokenu (time-to-first-token) przy użyciu prefix caching.
Pełny tekst pracy (373 KB) jest dostępny na arXiv pod identyfikatorem 2609.30017. Dokument nie zawiera informacji o kodzie źródłowym, zbiorach danych ani afiliacji autorów - tych danych w abstrakcie po prostu nie ma.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Moim zdaniem ta praca jest interesująca przede wszystkim dlatego, że atakuje konkretny, praktyczny problem: jak tanio znaleźć dobry model lub dobre rozwiązanie w dużej przestrzeni, gdy pełna ewaluacja jest droga. Liczby wyglądają przekonująco - szczególnie 3,6-krotna redukcja czasu do pierwszego tokenu to coś, co bezpośrednio przekłada się na doświadczenie użytkownika. Jednocześnie mamy tu tylko abstrakt, więc nie wiem, jak wyglądają szczegóły eksperymentów ani czy wyniki są replikowalne. Data zgłoszenia - wrzesień 2026 - sprawia, że jest to praca bardzo świeża i nieprzeszła jeszcze pełnej recenzji.
Źródło: arXiv cs.AI: Canopy: Exploiting Piecewise Smooth Tree Priors for Multi-Fidelity Bandits (dokument z 2026-09-25). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
