› Agent ReAct z GPT-4.1 na benchmarku AppWorld zdał wszystkie 5 prób zaledwie dla 53% zadań, mimo średniej skuteczności 77,4% - to luka 24,4 punktu procentowego.
› IBM Research opracował Consistency Analyzer, który wykrywa chwiejne punkty decyzyjne w zapisanej trajektorii agenta bez potrzeby ponownego uruchamiania całego zadania.
› Nowe wytyczne spójności (consistency guidelines) w systemie ALTK-Evolve zmniejszają tę lukę o połowę - z 24,4 do 12,0 pp - bez obniżania średniej dokładności.