› Artykuł pochodzi od siedmiorga autorów - Zheng Zhang, Liu Liu, Qi Chai, Deheng Ye, Peilin Zhao, Mao Zheng i Hao Wang - i został złożony na arXiv 23 września 2026 roku.Problem: statyczna pula scenariuszyAgenty oparte na dużych modelach językowych, które mają odgrywać role - na przykład w personalizowanej pomocy użytkownikowi albo w symulacjach społecznych - są dziś trenowane najczęściej metodami uczenia przez wzmacnianie (RL).
› Standardowe podejście polega na tym, że przed rozpoczęciem uczenia zbiera się pulę scenariuszy i przez cały trening pozostaje ona niezmieniona.
› Autorzy wskazują na konkretny problem z tym związany: gdy agent się poprawia, zestaw sytuacji, w których sobie nie radzi, też się zmienia - ale pula treningowa już nie.
› Tworzy to coś, co autorzy nazywają "distributional bottleneck", czyli wąskim gardłem dystrybucji.