CompoWorld: jak automatycznie generować środowiska treningowe dla agentów AI
Badacze opracowali metodę automatycznego tworzenia zadań treningowych dla agentów AI, które wymagają łączenia informacji i działań między wieloma usługami. Wytrenowany tą metodą model Qwen3.6-35B-A3B uzyskał średnio 9,17 punktu więcej niż jego bazowa wersja i pokonał Claude Opus 4.6 na benchmarku AutomationBench.

👁 119 przeczytań
Praca pochodzi z arXiv i nosi datę 27 września 2026 roku (z poprawką z 30 września 2026). Autorów jest dwunastu, na czele z Xiao-Wen Yangiem.
Problem, który autorzy chcieli rozwiązać
Trenowanie generalnych agentów AI wymaga dużych ilości danych z interakcji ze środowiskiem. Dotychczasowe metody automatycznego generowania takich danych działały jednak w obrębie jednego środowiska naraz. Tymczasem realne zadania - takie jak typowe przepływy pracy - wymagają od agenta łączenia informacji i działań między wieloma różnymi usługami jednocześnie. Autorzy uznali to za lukę, którą chcieli wypełnić.
Czym jest CompoWorld
CompoWorld to metoda zwana Compositional Environment Scaling - kompozycyjnym skalowaniem środowiska. Jej rdzeń to skończona biblioteka wielokrotnego użytku, złożona z serwisów (services). Agenty programistyczne przekształcają specyfikacje narzędzi w zweryfikowane serwisy z typowanymi stanami i wspólnymi interfejsami. W przypadku narzędzi, których nie da się w ten sposób wiarygodnie zaimplementować, autorzy stosują tzw. world model. Procedura losowego błądzenia (random-walk) łączy serwisy przez grafy zależności, co pozwala generować i weryfikować zadania wymagające przepływu informacji między serwisami.
W sumie autorzy zbudowali 448 serwisów udostępniających 10 130 narzędzi.
Jak wygląda trening modelu
Metoda łączy dwa etapy uczenia. Zweryfikowane trajektorie służą do nadzorowanego dostrajania modelu (SFT - supervised fine-tuning). Do uczenia przez wzmacnianie (RL) autorzy opracowali własną funkcję nagrody nazwaną Completion-Focused Rubric Reward. Jej zadaniem jest kierowanie modelu ku pełnemu ukończeniu zadania - robi to przez podkreślanie kryteriów z niższymi wskaźnikami zaliczenia w obrębie każdej grupy prób (rollout group). Na potrzeby eksperymentów użyto 3 000 trajektorii SFT i 1 000 zadań RL do wytrenowania modelu Qwen3.6-35B-A3B.
Wyniki
Autorzy testowali model na ośmiu benchmarkach. CompoWorld poprawił wyniki modelu bazowego średnio o 9,17 punktu. Na benchmarku AutomationBench wytrenowany model przewyższył Claude Opus 4.6 oraz wszystkie porównywane modele wyspecjalizowane w agentach o rozmiarze 35B-A3B. Dokument nie zawiera szczegółowych wyników dla każdego z ośmiu benchmarków z osobna - podana jest wyłącznie średnia.
Czego w dokumencie nie ma
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Dostępny tekst to wyłącznie abstrakt ze strony arXiv - nie ma w nim szczegółów dotyczących architektury world modelu, pełnych tabel wynikowych, opisu poszczególnych serwisów ani informacji o kosztach obliczeniowych treningu. Nie wiadomo też, kto finansował badania ani z jaką instytucją afiliowani są autorzy.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
To moja ocena, oddzielona od faktów. Jeśli wyniki się potwierdzą po lekturze pełnego artykułu, CompoWorld to interesująca odpowiedź na realne ograniczenie obecnych metod - brak danych treningowych obejmujących zadania wielousługowe. Wzrost o 9,17 punktu na ośmiu benchmarkach i pobicie Claude Opus 4.6 przez model klasy 35B brzmią przekonująco, ale abstrakt nie pokazuje, jak duże są to różnice bezwzględnie ani czy benchmarki są naprawdę reprezentatywne dla realnych zastosowań. Warto śledzić pełną wersję pracy, gdy się pojawi.
Źródło: arXiv cs.AI: CompoWorld: Compositional Environment Scaling for General Agents (dokument z 2026-10-01). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
