› Intelligence Index mierzy rozumowanie, matematykę i kod.
› Nie mierzy tego, co dla polskiego użytkownika najważniejsze: czy model pisze po polsku jak człowiek, czy jak tłumacz Google z 2015 roku.
› Dlatego robię własny test - ten sam zestaw zadań, te same kryteria, co miesiąc.
› Metodologia Każdy model dostaje identyczny zestaw 10 zadań: List formalny - pismo do urzędu z odwołaniem (rejestr urzędowy) Mail do klienta - odmowa rabatu bez palenia relacji (dyplomacja) Post na LinkedIn - bez korpomowy i „dostarczania wartości" Streszczenie - 2000 słów ustawy → 150 słów po ludzku Ironia - felietonowy akapit z drugim dnem Odmiana - tekst nasycony trudną fleksją (nazwiska, liczebniki, "w Zakopanem") Frazeologia - naturalne użycie idiomów bez kalk z angielskiego Rejestr potoczny - wiadomość do kumpla, która nie brzmi jak od HR-u Korekta - tekst z 10 ukrytymi błędami do znalezienia Styl autora - kontynuacja akapitu w zadanym stylu Ocena: 0-10 pkt za zadanie (poprawność 40%, naturalność 40%, wierność poleceniu 20%).