› Benchmarki agentów to najtrudniejsza kategoria pomiarów AI: nie wystarczy ładnie odpowiedzieć, trzeba faktycznie wykonać zadanie.
› Agent Arena mierzy to metryką "net improvement" - o ile procent agent realnie poprawia wynik zadania względem punktu odniesienia.
› Poniższe dane pochodzą z 12 lipca 2026 i opierają się na 1 054 218 sesjach.
› TOP 10 agentów wg Agent Arena #ModelTwórcaNet improvement 1Claude Fable 5 (High)Anthropic13,94% 2GPT 5.6 Sol (xHigh)OpenAI10,94% 3Claude Opus 4.8 (Thinking)Anthropic9,28% 4GPT 5.5 (xHigh)OpenAI8,26% 5Claude Sonnet 5 (High)Anthropic8,00% 6Claude Opus 4.7 (Thinking)Anthropic7,73% 7Claude Opus 4.7Anthropic7,63% 8GPT 5.5 (High)OpenAI7,16% 9GLM 5.2 (Max)Z.ai6,24% 10GPT 5.5OpenAI6,05% Co z tego wynika Trzy rzeczy rzucają się w oczy.