› Zbudowałem test dla jedenastu modeli: dziewięć zadań z kodu, tłumaczenia i trzymania się instrukcji, każde sprawdzane automatycznie, żeby nie oceniać gustem.
› Po przejrzeniu odpowiedzi okazało się, że na jednym zadaniu mój automat punktował odwrotnie.
› Modele, którym postawił zero, odpowiedziały poprawnie, a te z punktem się myliły.
› To jest ciekawsze od samego rankingu, więc zacznę od tego.