🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 7 szt. albo Pro na rok 464 zł Kup teraz →
Przejdź do treści
Nauka

ChatGPT ocenił studenta gorzej niż człowiek. Dlaczego?

Czy sztuczna inteligencja może sprawdzać zadania z programowania za nas? Okazuje się, że na razie częściej się myli niż pomaga. Nowy eksperyment pokazuje, czego maszynom wciąż brakuje.
pl.

3 min czytania
Ostatnia aktualizacja:
A human finger and a robotic finger touch over a circuit-like blueprint on a desk, symbolizing collaboration between people and technology in a classroom setting.

👁 117 przeczytań

// w skrócie
  • ChatGPT oceniał kod studentów gorzej niż człowiek, bo porównywał rozwiązania ze wzorcem zamiast sprawdzać, czy student rozumie algorytm.
  • Dopiero po dodaniu do prompta listy typowych błędów studenckich i wskazówek o pomijaniu drobnych niedociągnięć oceny modelu stały się nieco bardziej trafne.
  • Eksperyment z Harvard Medical School, opisany w Nature, wykazał, że sprawdzanie kodu jest procesem interpretacyjnym, a nie tylko techniczną kontrolą składni.

Jak sprawdzić sto prac z programowania, nie spędzając nad każdą pół godziny? Dla prowadzących kursy kodowania to codzienna udręka. Generatywna sztuczna inteligencja miała być wybawieniem. Jednak gdy naukowcy z Harvard Medical School oddali stos egzaminów ChatGPT, okazało się, że maszyna rozumie kod, ale nie rozumie studenta.

Test na żywym organizmie: ChatGPT kontra zadanie z algorytmów

Pewnego wieczoru Boyan Li, doktorant z Harvard Medical School, siedział przy kuchennym stole i sprawdzał zadania studentów. Każde wymagało uruchomienia kodu, prześledzenia logiki i oceny, czy student rozumie algorytm. Niektóre odpowiedzi były bezbłędne, inne - ewidentnie błędne. Lwią część stanowiły mimo to te pośrednie: działające, ale napisane po swojemu. To właśnie one zabierały najwięcej czasu.

Jego partnerka Ying Xu, badaczka edukacji wyższej, obserwowała ten proces z profesjonalnym zaciekawieniem. Uznała, że to idealny poligon doświadczalny: sprawdzić, czy ChatGPT potrafi odciążyć wykładowców w żmudnej robocie. Wyniki szybko położyły kres złudzeniom.

Porównywanie kodu a rozumienie intencji

Boyan Li dał chatbotowi treść zadania, wzorcowe rozwiązanie i poprosił o ocenę studenckiego kodu. Model OpenAI, ChatGPT 5.4, wziął się do roboty z zapałem - i od razu wpadł w pułapkę. Głównie porównywał przesłany kod z referencyjnym, tropiąc różnice, a nie oceniając, czy student opanował materiał.

Zamiast docenić inną, ale poprawną implementację algorytmu, ChatGPT czepiał się drobiazgów - na przykład tego, że rozwiązanie jest odrobinę mniej wydajne obliczeniowo. Zupełnie zignorował główny cel dydaktyczny: sprawdzenie, czy student rozumie, jak działa dany algorytm. Innymi słowy, model wyłapywał szczegóły, gubiąc sedno.

Gdzie tkwi błąd? Brak kontekstu i „szarej strefy”

Obserwując frustrację męża, Ying Xu szybko zrozumiała, co poszło nie tak. ChatGPT działał w próżni - nie miał pojęcia, które błędy są typowe dla początkujących, a które detale można uznać za nieistotne. Maszyna nie odróżniała pomyłki koncepcyjnej od alternatywnego, ale poprawnego toku myślenia.

Dlatego Xu zaproponowała prostą modyfikację: dajmy modelowi kontekst. Do prompta dopisano listę typowych błędów studenckich oraz wskazówkę, które drobne niedociągnięcia można pominąć. Dopiero wtedy oceny ChatGPT stały się nieco bardziej trafne. Eksperyment ujawnił niemniej fundamentalną prawdę: ocenianie to nie tylko techniczna kontrola, ale też interpretacja ludzkiego rozumowania.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Konsekwencje dla edukacji i przyszłość AI w szkolnictwie

Eksperyment z Harvard Medical School pokazuje coś ważnego. Wbrew pozorom kod wcale nie jest dla AI łatwiejszy od esejów. Owszem, podlega ścisłym regułom składni, ale za każdą linijką stoi decyzja programisty - a tę trzeba zrozumieć, nie tylko porównać do wzorca. Ying Xu, cytowana w raporcie w Nature, zwraca uwagę, że samo sprawdzanie kodu to proces głęboko interpretacyjny: wykładowca prowadzi „dialog” z uczniem, próbując odczytać jego tok myślenia.

Czy to oznacza, że chatboty nie nadają się do edukacji? Niekoniecznie. Ich rola może być inna - nie jako bezmyślny egzaminator, lecz asystent, który wstępnie przefiltruje oczywiste błędy, a resztę zostawi człowiekowi. Ale dopóki AI nie nauczy się czytać między linijkami - i rozumieć, że istnieje więcej niż jedna poprawna ścieżka - wykładowcy mogą spać spokojnie. Jeszcze długo nikt im butów nie zdejmie.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Dlaczego ChatGPT gorzej oceniał zadania studentów niż wykładowca?

ChatGPT skupiał się na porównywaniu kodu ze wzorcem i wyłapywał drobne różnice, zamiast oceniać, czy student rozumie działanie algorytmu. Model nie odróżniał pomyłki koncepcyjnej od alternatywnej, ale poprawnej implementacji.

Jaki model ChatGPT był testowany w eksperymencie z Harvard Medical School?

W eksperymencie użyto modelu ChatGPT 5.4 od OpenAI. To właśnie ten model oceniał studenckie rozwiązania zadań z algorytmów.

Jak poprawić ocenianie kodu przez ChatGPT?

Badaczka Ying Xu zaproponowała dodanie do prompta listy typowych błędów studenckich oraz wskazówki, które niedociągnięcia można pominąć. Taka modyfikacja sprawiła, że oceny modelu stały się nieco bardziej trafne.

Czy AI nadaje się do oceniania prac studentów z programowania?

Według eksperymentu z Harvard Medical School AI może pełnić rolę asystenta wstępnie filtrującego oczywiste błędy, ale nie zastąpi wykładowcy w pełnej ocenie. Ocenianie kodu wymaga interpretacji toku myślenia studenta, a nie tylko porównania z wzorcowym rozwiązaniem.

$ źródłoCzytaj oryginał na noktus.pl
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie