PROMPTOWY_
Newsy

Agent zaliczy zadanie raz. Czy zrobi to samo przy kolejnym podejściu?

promptowy@ai:~$ cat news_1

Agent ReAct z GPT-4.1 na benchmarku AppWorld zdał wszystkie 5 prób zaledwie dla 53% zadań, mimo średniej skuteczności 77,4% - to luka 24,4 punktu procentowego.

promptowy@ai:~$ cat news_2

IBM Research opracował Consistency Analyzer, który wykrywa chwiejne punkty decyzyjne w zapisanej trajektorii agenta bez potrzeby ponownego uruchamiania całego zadania.

promptowy@ai:~$ cat news_3

Nowe wytyczne spójności (consistency guidelines) w systemie ALTK-Evolve zmniejszają tę lukę o połowę - z 24,4 do 12,0 pp - bez obniżania średniej dokładności.

promptowy@ai:~$ open --full
Czytaj całość

Agent zaliczy zadanie raz. Czy zrobi to samo przy kolejnym podejściu?

Otwórz artykuł na promptowy.com