› Dałem czterem chińskim modelom językowym te same zadania po polsku: Kimi K3 od Moonshot AI, GLM-5.3 od Z.ai, Qwen3.8 Max od Alibaby i DeepSeeka w dwóch wersjach (V4.1 Flash i V4 Pro).
› Wygrał DeepSeek - obie wersje zdobyły po 93,3 pkt na 100.
› Kimi K3 był trzeci (89,2 pkt), Qwen czwarty (82,5), GLM ostatni (80,1).
› Cały test kosztował mnie 0,37 USD, razem z jedną powtórką.