› Dzisiejszy dzień w świecie AI przyniósł tematy z bardzo różnych stron - od politycznych ruchów Trumpa w kwestii nadzoru nad sztuczną inteligencją, przez niepokojące dane o nielegalnych materiałach generowanych przez AI, aż po zmiany cenowe modeli i praktyczne porady o promptowaniu.
› Nie zabrakło też głosu krytycznego wobec branży i naukowej weryfikacji metod oceny agentów LLM.
› Metodologia oceny agentów LLM wymaga rewizji Badacze ujawnili dwa poważne błędy w dotychczasowym podejściu do oceniania metod automatycznej ewolucji harnessy dla agentów opartych na LLM.
› Okazuje się, że metody te często nie przewyższają prostych punktów odniesienia, a ich sukcesy mogą być efektem przetrenowania na danych testowych.