Cztery modele, jedno zadanie i cała prawda o tym, że żaden nie pisze za mnie
Cztery modele, jedno zadanie i jedna niewygodna teza: to nie AI pisze teksty, tylko ujawnia, czy w ogóle masz coś do powiedzenia.
👁 162 przeczytań
- Żaden z czterech testowanych modeli - GPT, Claude, Gemini ani Grok - nie napisał tekstu, który autor byłby gotów podpisać własnym nazwiskiem.
- Gdy autor podał modelom własne, niedopracowane trzy akapity zamiast pustego prompta, Claude najlepiej łapał jego ton i najrzadziej poprawiał tam, gdzie nie prosił.
- Modele bez wejściowej myśli zwracają statystycznie najbardziej prawdopodobną odpowiedź - teksty różne stylem, lecz jednakowo pozbawione zdania, którego nie dałoby się przewidzieć.
Postawię tezę już w drugim zdaniu, żeby nikt nie musiał się męczyć do końca w niepewności: żaden z tych czterech modeli nie napisze za ciebie dobrego tekstu, a ten, który wydaje ci się najlepszy, mówi więcej o tobie niż o modelu. To jest cały felieton. Reszta to dowód, dygresje i moja prywatna satysfakcja, że mogę to napisać, zanim ktoś sprzeda wam kolejny kurs „pisz artykuły w trzy minuty jednym promptem”.
Zrobiłem eksperyment, który znacie z tysiąca filmików na YouTube, tyle że tam zwykle kończy się na „wow, niesamowite, zostawcie suba”. Wziąłem cztery modele - nazwijmy je po rodzinach, bo wersje zmieniają się szybciej, niż zdążę dopisać ten akapit: GPT od OpenAI, Claude od Anthropic, Gemini od Google i Grok od xAI. Dałem każdemu z nich dokładnie ten sam prompt. Krótki, ludzki, bez żadnej promptowej magii: „Napisz artykuł o tym, dlaczego ludzie odkładają rzeczy na później”. Zero instrukcji o tonie, długości, grupie docelowej. Chciałem zobaczyć, co robi model, kiedy zostawiam go samego z pustką - dokładnie tak, jak zostawia się z pustką człowieka.

Cztery odpowiedzi na jedno pytanie, którego nikt nie zadał do końca
Pierwsza rzecz, która mnie uderzyła: wszystkie cztery zrozumiały polecenie. Wszystkie cztery zwróciły coś, co wygląda jak artykuł. Ma tytuł, ma wstęp, ma śródtytuły, ma zgrabne zakończenie z lekkim morałem. I gdybym był leniwy, gdybym był tym redaktorem contentu, który wrzuca dwadzieścia tekstów dziennie na farmę treści, powiedziałbym: świetnie, cztery gotowce, biorę wszystkie, płacę abonament, idę na kawę. Problem w tym, że kiedy się je czyta obok siebie, zaczynają się różnić w sposób, który jest fascynujący i - powiem szczerze - trochę niepokojący.
GPT napisał tekst, który nazwałbym „kompetentnym urzędnikiem”. Wszystko na miejscu, akapity równej długości, definicja prokrastynacji jak z dobrego podręcznika, trzy przyczyny, trzy rozwiązania, klamra. Czyta się to gładko jak jazdę po autostradzie i równie dobrze się to zapamiętuje - czyli wcale. To jest proza, która nie ma ani jednego ostrego kanta, o który mógłbyś się zahaczyć i pomyśleć: „o, to ciekawe”. Perfekcyjna średnia. Wypadkowa całego internetu, na którym się uczył, uśredniona do stanu, w którym nie da się jej nie znieść, ale też nie da się jej pokochać.
Claude poszedł w drugą stronę i to mnie ujęło, bo - zdradzę osobistą słabość - to model, z którym pracuje mi się najlepiej. Jego tekst miał rytm. Miał zdania różnej długości, miał jedno takie, które zawieszało głos przed puentą. Wyczułem w nim próbę bycia autorem, a nie tylko generatorem. Ale wyczułem też coś jeszcze: pewną grzeczność, wręcz nadopiekuńczość. Claude bardzo chce, żebyś się dobrze poczuł ze swoją prokrastynacją, żebyś nie miał wyrzutów, żeby wszystko było empatyczne i ciepłe. Momentami tak ciepłe, że aż mdłe. To jest ten kolega, który zamiast powiedzieć „weź się w garść”, robi ci herbatę i tłumaczy, że twój mózg po prostu szuka bezpieczeństwa.
Gemini dał mi tekst najbardziej „internetowy” - taki, który mógłby wygrać w Google, bo najwyraźniej został pomyślany, żeby wygrywać w Google. Nagłówki jak pytania, listy wypunktowane, wtręty typu „badania pokazują” bez wskazania, jakie badania (i tu zapaliła mi się czerwona lampka, ale o tym za chwilę). To była treść zoptymalizowana pod maszynę, która ją potem wyświetli innej maszynie. Zamknięty obieg. Robot pisze dla robota, a człowiek jest tu przypadkowym świadkiem.
Grok próbował być zabawny. I trzeba mu oddać - czasem był. Wrzucił żart o tym, że pewnie czytasz ten artykuł zamiast robić coś ważnego, co jest tanim chwytem, ale zadziałało, bo prawdziwe. Problem w tym, że dowcip u modelu językowego działa jak papryczka chili wsypana do każdej potrawy. Raz świetnie, dwa razy w porządku, a przy piątym akapicie masz ochotę poprosić, żeby przestał się wygłupiać i wreszcie coś powiedział.
Cztery style, jeden problem: nikt z nich nie wie, o czym mówi
I tu dochodzimy do sedna, które w tych wszystkich porównaniach na YouTube ginie pod tabelkami z ptaszkami. Bo ludzie porównują te modele jak samochody: który ma lepsze przyspieszenie, który ładniej brzmi, który ma więcej „wow”. A ja siedziałem z tymi czterema tekstami i myślałem o czymś zupełnie innym.
Żaden z nich nie prokrastynował. Żaden nigdy nie odłożył niczego na później. Żaden nie leżał w niedzielny wieczór, gapiąc się w sufit, z tym charakterystycznym ściskiem w żołądku, kiedy wiesz, że jutro deadline, a ty od trzech godzin czytasz recenzje odkurzaczy, których nie zamierzasz kupić. Cztery modele napisały mi cztery artykuły o doświadczeniu, którego nie mają i mieć nie mogą. I zrobiły to zaskakująco dobrze - bo przeczytały miliony tekstów napisanych przez nas, prokrastynatorów. Są jak krytyk kulinarny bez kubków smakowych, który zna wszystkie recenzje wszystkich restauracji świata.
Model językowy nie pisze o świecie. Pisze o tym, co już zostało o świecie napisane. To dwie zupełnie różne rzeczy, a cała ta branża udaje, że to jedna i ta sama.
Dlatego wszystkie cztery teksty, przy całej różnicy stylu, miały tę samą wadę: były o niczym konkretnym. Ani jeden nie zawierał zdania, którego nie dałoby się przewidzieć. Ani jednej myśli, która by mnie zatrzymała, bo była naprawdę czyjaś. Ani jednego wstydu, ryzyka, ani jednej rzeczy, którą autor bałby się napisać. A dobry tekst - twierdzę to z uporem od lat - zawsze zawiera coś, czego autor trochę się boi.

Kto tu jest naprawdę testowany
Zrobiłem potem drugą turę. Tym razem nie napisałem „napisz artykuł”. Napisałem trzy akapity brudnej, koślawej, mojej własnej myśli - takiej z błędami, z niedokończonym zdaniem, z pomysłem, który sam jeszcze nie wiedziałem, dokąd zmierza. I poprosiłem każdy model, żeby to rozwinął, zachowując mój sposób myślenia.
I nagle wszystko się zmieniło. Nagle te same cztery modele przestały być czterema wersjami tej samej nudy, a stały się czterema różnymi współpracownikami przy moim biurku. GPT porządkował mój chaos, czasem za bardzo - wyprasowywał zdania, które celowo zostawiłem pogniecione. Claude wchodził w mój ton, dopisywał w moim rytmie i - to było niesamowite - potrafił dokończyć myśl mniej więcej tam, gdzie sam bym ją poprowadził. Gemini dorzucał struktury i kontekstu, jakby chciał, żeby mój tekst był bardziej „znajdowalny”. Grok podrzucał żart, który raz na trzy był lepszy od moich.
Różnica między pierwszą a drugą turą jest całym sednem tego felietonu. Gdy nic nie wnosisz, modele dają ci uśrednioną papkę, którą można rozpoznać z kilometra. Gdy wnosisz siebie, stają się wzmacniaczem. To nie są maszyny do produkcji treści. To są lustra z lekkim opóźnieniem i całkiem niezłą pamięcią cudzych zdań. Odbijają to, co im dasz. Dasz pustkę - oddadzą wypełnioną, wygładzoną pustkę. Dasz myśl - oddadzą myśl w lepszym garniturze.
I tu jest ta niewygodna prawda, o której nikt nie chce mówić, bo się źle sprzedaje. Ludzie kupują te narzędzia z nadzieją, że wreszcie nie będą musieli myśleć. Że wrzucą temat, wcisną enter i dostaną gotowca, który udaje ich pracę. I owszem, dostaną. Tylko że wszyscy inni dostaną dokładnie to samo, bo pytają tego samego modelu tego samego dnia to samo pytanie. Internet zalewa się treścią, która jest statystycznie najbardziej prawdopodobną odpowiedzią na najbardziej oczywiste pytanie. Ocean tekstu, w którym nie ma ani jednej kropli czyjegoś prawdziwego doświadczenia.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Który wygrał, czyli pytanie źle postawione
Wiem, po co część z was tu przyszła. Chcecie werdyktu. Który wygrał. Więc dam wam werdykt, ale nie ten, którego oczekujecie.
W kategorii „napisz mi coś, żebym nie musiał” wygrał remis, bo wszyscy przegrali - dali mi treść, której nie chciałbym podpisać własnym nazwiskiem. W kategorii „pomóż mi napisać to, co już myślę” moim prywatnym faworytem został Claude, bo najlepiej łapie ton i najmniej próbuje mnie poprawiać tam, gdzie nie proszę. GPT jest najbardziej niezawodnym rzemieślnikiem, kiedy potrzebuję czegoś zrobionego solidnie i szybko. Gemini bierze, gdy zależy mi na researchu i strukturze pod konkretny cel. Grok - kiedy chcę, żeby ktoś rozluźnił mi zdanie, które za bardzo się spięło.
Ale to wszystko jest jak pytanie, który pędzel jest najlepszy. Odpowiedź brzmi: zależy, co malujesz i czy w ogóle umiesz malować. Pędzel Rembrandta w mojej ręce nie namaluje Rembrandta. Namaluje moją nieudolność, tyle że gładszą kreską.
Bo prawdziwym testem tego eksperymentu nie były cztery modele. Prawdziwym testem byłem ja. To, jaki prompt napisałem. To, czy miałem myśl, czy tylko temat. To, czy potrafiłem odróżnić tekst gładki od tekstu prawdziwego - bo umiejętność tego rozróżnienia to dziś najbardziej niedoceniana kompetencja świata. Cztery modele nie sprawdzały siebie nawzajem. One cały czas sprawdzały mnie.
I dlatego kończę tam, gdzie zacząłem, tylko z większym przekonaniem. Możecie mieć dostęp do wszystkich czterech naraz, do dziesięciu, do stu. Możecie kupić najdroższe abonamenty i najsprytniejsze prompty. Ale w chwili, kiedy siadasz przed pustym polem tekstowym, wraca to samo pytanie, które dręczyło każdego autora od czasu wynalezienia pisma: czy masz coś do powiedzenia? Jeśli tak - te maszyny są cudownym wzmacniaczem twojego głosu. Jeśli nie - są najszybszą na świecie fabryką ciszy, która brzmi jak mówienie. A najsmutniejsze jest to, że coraz trudniej odróżnić jedno od drugiego. Chyba że wciąż masz odwagę napisać zdanie, którego trochę się boisz.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Który model AI najlepiej pisze artykuły - GPT, Claude, Gemini czy Grok?
Według autora nie ma jednego zwycięzcy, bo przy pustym prompcie wszystkie cztery przegrały, dając treść bez oryginalnej myśli. Gdy dostarczył własny materiał, jego prywatnym faworytem został Claude za najlepsze łapanie tonu, GPT uznał za najbardziej niezawodnego rzemieślnika, Gemini za przydatny do struktury i researchu, a Grok za rozluźnianie zbyt spiętych zdań.
Co się stało, gdy autor dał modelom własne brudne notatki zamiast ogólnego polecenia?
Cztery modele przestały produkować podobną treść i zaczęły zachowywać się jak czterech różnych współpracowników. Claude dopisywał w rytmie autora i kończył myśl w przewidywanym kierunku, GPT porządkował chaos - czasem za mocno wyprasowując celowo pogniecione zdania, Gemini dorzucał strukturę, a Grok podrzucał żarty, z których co trzeci był lepszy od autorskich.
Dlaczego artykuły generowane przez AI są do siebie podobne?
Modele językowe nie piszą o świecie, lecz o tym, co już zostało o świecie napisane - autor porównuje je do krytyka kulinarnego bez kubków smakowych, który zna wszystkie recenzje restauracji. Przy tym samym pytaniu zadanym tego samego dnia różni użytkownicy dostają statystycznie najbardziej prawdopodobną odpowiedź, co zalewa internet treścią bez żadnego prawdziwego doświadczenia.
Czym różnił się styl tekstu Geminiego od pozostałych modeli w tym teście?
Gemini napisał tekst najbardziej zoptymalizowany pod wyszukiwarkę - z nagłówkami w formie pytań, listami wypunktowanymi i ogólnikowymi odwołaniami do badań bez podania ich źródła. Autor ocenił go jako treść stworzoną przez robota dla robota, w której człowiek jest tylko przypadkowym świadkiem.



