Przejdź do treści
Newsy

Canopy: algorytm banditowy dla LLM, który uczy się gdzie drzewo jest gładkie

Badacze Michael Jerge i Suman Jana proponują metodę CANOPY, która optymalizuje wiele problemów związanych z inferencją modeli językowych - od routingu po przycinanie promptów. Zamiast zakładać z góry, że przestrzeń rozwiązań jest wszędzie równomiernie gładka, algorytm sam wykrywa, gdzie to założenie nie działa.

3 min czytania
Canopy: algorytm banditowy dla LLM, który uczy się gdzie drzewo jest gładkie

👁 121 przeczytań

Praca pochodzi z arXiv (zgłoszona 24 września 2026) i dotyczy kategorii uczenia maszynowego. Autorzy to Michael Jerge oraz Suman Jana.

Problem: drzewo jako model inferencji LLM

Autorzy wychodzą od obserwacji, że wiele zadań związanych z inferencją dużych modeli językowych da się przedstawić jako optymalizację po drzewie. Konkretnie wymieniają: routing modeli, zarządzanie pamięcią podręczną prefiksów (prefix-cache management), przycinanie promptów (prompt trimming) oraz przeszukiwanie w czasie inferencji (test-time search). Struktura drzewiasta wynika wprost z autoregresywnego generowania tekstu - każdy prefiks definiuje węzeł, a jego możliwe kontynuacje tworzą poddrzewo poniżej.

W takim drzewie węzły wewnętrzne dają tanie, ale obciążone błędem oszacowania wartości danego regionu. Liście dają dokładną ocenę, ale są kosztowne obliczeniowo. Istnieją już hierarchiczne metody banditowe, które wykorzystują tę strukturę, ale wymagają z góry zdefiniowanego harmonogramu gładkości (smoothness schedule). Problem w tym, że realne funkcje celu są często tylko kawałkami gładkie, a ich optimum może leżeć blisko ostrej granicy.

Rozwiązanie: CANOPY

Zaproponowany algorytm CANOPY to wielorozdzielczy (multi-fidelity) bandit drzewiasty, który zamiast globalnie zakładać gładkość - uczy się, gdzie to założenie jest trafne. Mechanizm działa w dwóch krokach: najpierw tanie losowe próbkowanie ścieżek (random-path probes) buduje tzw. certyfikat lokalnej biasowości agregacji (certificate of local aggregation bias). Następnie drogie ewaluacje liści kierowane są właśnie tam, gdzie certyfikat wykrywa naruszenie założenia o gładkości.

Autorzy dowodzą gwarancji zarówno dla stałego budżetu (fixed-budget), jak i dla żalu (regret). Dodatkowy koszt wynikający z wykrywania nieciągłości jest addytywny względem liczby tych nieciągłości. Gdy nieciągłości nie ma, algorytm odzyskuje tempo charakterystyczne dla gładkiego drzewa. Gdy nieciągłości są gęste, zachowuje się jak przeszukiwanie bez wiedzy o strukturze.

Wyniki eksperymentalne

Autorzy testowali CANOPY na kilku zadaniach: routing modeli, identyfikacja top-k, przeszukiwanie w czasie inferencji, cachowanie oraz przycinanie promptów. We wszystkich przypadkach CANOPY poprawia wyniki przy tym samym budżecie obliczeniowym. Konkretne liczby podane w abstrakcie:

- 2,9-krotnie wyższy recall w top-10 na puli 1000 modeli,
- 1,6-krotnie więcej rozwiązanych zadań SWE-bench Verified w porównaniu do best-of-N,
- 3,6-krotnie niższy medianowy czas do pierwszego tokenu (time-to-first-token) przy użyciu prefix caching.

Pełny tekst pracy (373 KB) jest dostępny na arXiv pod identyfikatorem 2609.30017. Dokument nie zawiera informacji o kodzie źródłowym, zbiorach danych ani afiliacji autorów - tych danych w abstrakcie po prostu nie ma.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Co z tego wynika

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Moim zdaniem ta praca jest interesująca przede wszystkim dlatego, że atakuje konkretny, praktyczny problem: jak tanio znaleźć dobry model lub dobre rozwiązanie w dużej przestrzeni, gdy pełna ewaluacja jest droga. Liczby wyglądają przekonująco - szczególnie 3,6-krotna redukcja czasu do pierwszego tokenu to coś, co bezpośrednio przekłada się na doświadczenie użytkownika. Jednocześnie mamy tu tylko abstrakt, więc nie wiem, jak wyglądają szczegóły eksperymentów ani czy wyniki są replikowalne. Data zgłoszenia - wrzesień 2026 - sprawia, że jest to praca bardzo świeża i nieprzeszła jeszcze pełnej recenzji.

Źródło: arXiv cs.AI: Canopy: Exploiting Piecewise Smooth Tree Priors for Multi-Fidelity Bandits (dokument z 2026-09-25). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›