Przejdź do treści
🔬 Nauka

Sztuczna inteligencja ocenia studentów. Nowe badanie ujawnia, na czym się myli

Badacze z Cambridge sprawdzili, jak trzy największe modele językowe radzą sobie z ocenianiem prac studentów. Wyniki pokazują, że AI nagradza styl, a nie treść - i popełnia te same błędy co do joty.
pl.

4 min czytania
Ostatnia aktualizacja:
Empty classroom with a wooden teacher's desk at the front and a stack of papers on top, rows of desks facing forward.

👁 128 przeczytań

Wyobraź sobie, że piszesz esej na egzaminie. Starannie dobierasz argumenty, cytujesz literaturę, budujesz logiczny wywód. Oddajesz pracę i czekasz na ocenę. A potem okazuje się, że twoją przyszłość akademicką ważył algorytm, który nagradza długie zdania i rzadkie słowa - niezależnie od tego, co one znaczą.

To nie jest scenariusz z filmu science fiction. To rzeczywistość, którą właśnie zbadali naukowcy z Uniwersytetu Cambridge. W projekcie OpRaise sprawdzili, jak trzy czołowe modele językowe radzą sobie z ocenianiem pisemnych prac studentów. I wyniki są niepokojące.

Google · Twoje źródłaDodaj promptowy.com do preferowanych źródeł w Google

761 prac, trzy modele, jeden wniosek

Zespół zebrał 761 autentycznych prac z psychologii napisanych przez studentów trzech uczelni - Cambridge, Nottingham i Manchester Metropolitan - między 2022 a 2025 rokiem. Każda praca miała już ocenę wystawioną przez człowieka. Teraz te same teksty trafiły do trzech wielkich modeli językowych: Claude Opus 4.6 (Anthropic), GPT-5.4 (OpenAI) i Gemini 3 Flash (Google).

Badacze testowali różne sposoby formułowania poleceń - od prostego „jesteś doświadczonym egzaminatorem” po szczegółowe instrukcje z rubryką oceniania. Szukali konfiguracji, która da najlepsze wyniki. Żadna nie okazała się wystarczająco dobra.

Kluczowym miernikiem była zgodność kategorii oceny przyznanej przez AI z tą przyznaną przez człowieka. W przypadku prac z Cambridge maszyna trafiała w 63% przypadków, w Nottingham w 53%, a w Manchester Metropolitan w zaledwie 35%. Różnice te badacze wiążą z typem prac i rozpiętością ocen - im szersza skala, tym gorzej radził sobie algorytm.

Styl zamiast treści - systematyczny błąd AI

Najważniejsze odkrycie nie dotyczyło jednak samego poziomu błędów, ale ich charakteru. Wszystkie trzy modele wykazywały nadmierną wrażliwość na cechy czysto językowe: długość eseju, bogactwo słownictwa, złożoność składniową zdań, gęstość spójników. Dłuższy tekst z rzadkimi słowami i rozbudowanymi zdaniami złożonymi dostawał od AI wyższe oceny - niezależnie od jakości argumentacji.

Ludzcy egzaminatorzy byli na te cechy niemal całkowicie nieczuli. Oceniali rozumowanie, umiejętność syntezy literatury, trafność wniosków - czyli to, co w akademickiej psychologii stanowi o wartości pracy. AI natomiast nagradzała styl. Nagradzała to, co dało się zmierzyć.

Towarzyszył temu drugi systematyczny błąd - unikanie skrajności. Badacze nazwali go „tendencją centralną”. Modele spychały oceny ku środkowi skali: zawyżały słabe eseje, zaniżały wybitne. Praca, którą człowiek ocenił na 75 punktów, od AI dostawała średnio kilka punktów mniej. Praca z 50 punktami otrzymywała kilka punktów więcej. Granica zgodności między algorytmem a egzaminatorem przebiegała gdzieś w okolicach 58-62 punktów - tam, gdzie decyzja jest stosunkowo łatwa. Natomiast tam, gdzie naprawdę liczy się dobre zrozumienie i przeanalizowanie pracy - na granicy między wyróżnieniem a bardzo dobrym albo między zaliczeniem a niezaliczeniem - AI radziła sobie najgorzej.

Wszystkie modele popełniają te same błędy

Osobną obserwacją jest to, że trzy modele różnych producentów były do siebie nawzajem znacznie bardziej podobne niż każdy z nich był podobny do ludzkich egzaminatorów. Ich wewnętrzna spójność w czasie była niemal idealna - oceniając te same prace, dawały niemal identyczne wyniki. To jednak nie zaleta. Oznacza, że algorytmy popełniają te same błędy konsekwentnie i wspólnie. Wysoka zgodność między modelami nie przybliża ich do prawdy, a jedynie utrwala identyczny, systematyczny błąd.

Głos studentów i wykładowców: ocenianie to relacja, nie statystyka

Równolegle z analizą ilościową badacze przeprowadzili wywiady fokusowe ze studentami i wykładowcami. I tu padły słowa, których nie sposób zbagatelizować. Uczestnicy opisywali ocenianie jako element głębszej relacji między uczelnią a studentem - opartej na zaufaniu, wzajemnym szacunku i przekonaniu, że praca została naprawdę przeczytana. Studenci mówili, że czuliby się oszukani, gdyby ich eseje oceniała maszyna. Wykładowcy ostrzegali, że AI odcina to, co w ocenianiu jest niewidzialne i niepoliczalne: znajomość studenta, kontekst jego wysiłku, niuanse myślenia widoczne między wierszami. Jeden z akademików z Manchester Metropolitan stwierdził: „AI nie uwzględni rozmów, dyskusji, intelektualnych błysków, które student miał przez cały semestr”.

Raport OpRaise nie stwierdza, że dla LLM nie ma miejsca w ocenianiu. AI może wykrywać niespójności formalne, sprawdzać, czy praca spełnia podstawowe kryteria, alarmować, gdy jej ocena drastycznie odbiega od ludzkiej - co sugeruje, że warto daną pracę przejrzeć uważniej. To rola asystenta, nie egzaminatora. I chyba właśnie o to chodzi: żebyśmy nie dali się uwieść pozorom obiektywizmu maszyny, która mierzy to, co łatwo zmierzyć, a gubi to, co najważniejsze.

$ źródłoCzytaj oryginał na noktus.pl
// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Wypisujesz się jednym kliknięciem.
Co o tym sądzisz?
Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

$ sitemap --all Cała strona w jednym miejscu - żeby się nie pogubić.
🛒 Sklep Kinetyka X Premium+ & SuperGrok 699 zł/rok CapCut Pro 600 zł/rok LinkedIn Premium od 149 zł/rok Zobacz wszystko → 💙 wspieraj
Redaguje
× powiększenie