PROMPTOWY_
Newsy

AdvRole: zamknięta pętla uczenia agentów RPG na trudniejszych scenariuszach

promptowy@ai:~$ cat news_1

› Artykuł pochodzi od siedmiorga autorów - Zheng Zhang, Liu Liu, Qi Chai, Deheng Ye, Peilin Zhao, Mao Zheng i Hao Wang - i został złożony na arXiv 23 września 2026 roku.Problem: statyczna pula scenariuszyAgenty oparte na dużych modelach językowych, które mają odgrywać role - na przykład w personalizowanej pomocy użytkownikowi albo w symulacjach społecznych - są dziś trenowane najczęściej metodami uczenia przez wzmacnianie (RL).

promptowy@ai:~$ cat news_2

› Standardowe podejście polega na tym, że przed rozpoczęciem uczenia zbiera się pulę scenariuszy i przez cały trening pozostaje ona niezmieniona.

promptowy@ai:~$ cat news_3

› Autorzy wskazują na konkretny problem z tym związany: gdy agent się poprawia, zestaw sytuacji, w których sobie nie radzi, też się zmienia - ale pula treningowa już nie.

promptowy@ai:~$ cat news_4

› Tworzy to coś, co autorzy nazywają "distributional bottleneck", czyli wąskim gardłem dystrybucji.

promptowy@ai:~$ open --full
Czytaj całość

AdvRole: zamknięta pętla uczenia agentów RPG na trudniejszych scenariuszach

Otwórz artykuł na promptowy.com