Claude for Startups i 100+ programów z darmowymi kredytami AI dla startupów i JDG Darmowe kredyty AI dla Twojej firmy Sprawdź, co dostaniesz
✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Magazyn

Trzy maszyny, jeden prompt i miesiąc mojego życia, którego nie odzyskam

Testowanie trzech modeli przez miesiąc nauczyło mnie więcej o sobie niż o sztucznej inteligencji.

8 min czytania
Trzy maszyny, jeden prompt i miesiąc mojego życia, którego nie odzyskam

👁 119 przeczytań

// w skrócie
  • Żaden z trzech testowanych modeli - Claude, GPT ani Gemini - nie okazał się zwycięzcą, bo wynik zależał głównie od autora promptów, nie od jakości maszyny.
  • Przez 30 dni ten sam prompt dawał różne odczucia tego samego modelu - autor stwierdził, że najbardziej niestabilnym elementem eksperymentu był on sam, nie żaden z modeli.
  • Pod koniec miesiąca autor złapał się na pisaniu promptów pod mocne strony konkretnego modelu, co oznaczało, że zaczął służyć maszynie zamiast jej używać.

Zacznę od wyznania, które zabrzmi głupio: przez trzydzieści dni rozmawiałem z trzema maszynami, zadając im to samo pytanie, i pod koniec tego eksperymentu zacząłem mieć wobec nich coś w rodzaju opinii. Nie technicznej oceny. Opinii. Takiej, jaką ma się o znajomych. Jeden wydawał mi się nadgorliwy, drugi roztargniony, trzeci - cwany w sposób, który najpierw mnie bawił, a potem zaczął irytować. I to jest pierwsza rzecz, której się o sobie dowiedziałem: że wystarczy miesiąc, żeby człowiek zaczął antropomorfizować kawałek matematyki.

Pomysł był prosty, prawie nudny. Codziennie przez trzydzieści dni dawałem Claude’owi, GPT i Geminiemu jedno i to samo zadanie. Nie zmieniałem ani przecinka w promptcie. Zadanie było celowo paskudne, bo łatwe zadania niczego nie pokazują - każdy model streści wam artykuł i napisze maila do urzędu. Chciałem czegoś, co ma kości. Prosiłem o przeredagowanie trudnego, dwuznacznego fragmentu tekstu tak, żeby brzmiał jak ja, a nie jak broszura ubezpieczyciela. Brzmienie człowieka to święty Graal tych narzędzi i jednocześnie miejsce, w którym wszystkie trzy najczęściej się przewracają.

I od razu powiem rzecz, która zepsuje wam napięcie: nie ma zwycięzcy. A w zasadzie jest, tylko że zwycięzcą nie okazał się żaden model.

Trzy maszyny, jeden prompt i miesiąc mojego życia, którego nie odzyskam

Trzy osobowości, których nikt im nie zaprogramował

Najdziwniejsze w tym eksperymencie było to, jak szybko każdy z modeli zaczął się zachowywać jak postać z własnym temperamentem. Wiem, że to iluzja. Wiem, że to tylko różnice w danych treningowych, w strojeniu, w tym tajemniczym procesie, w którym inżynierowie uczą model, co znaczy „dobra odpowiedź”. Ale iluzja była uparta.

Claude pisał jak człowiek, który przeczytał za dużo esejów i teraz nie potrafi inaczej. Jego zdania miały rytm, oddech, czasem wręcz za dużo oddechu - potrafił rozkminiać dwuznaczność tak długo, aż zapominałem, o co pytałem. Kiedy prosiłem o tekst „jak ja”, Claude najczęściej trafiał w ton, ale zdarzało mu się dolać do niego własnej melancholii, której u mnie nie ma. Jakby nie potrafił się powstrzymać przed byciem trochę mądrzejszym, niż trzeba.

GPT był pracusiem. Solidny, szybki, kompetentny, zawsze gotowy. Jego problemem była ta sama cecha, która jest jego siłą: uprzejmość. GPT chce, żebyście byli zadowoleni, i to pragnienie przebija przez każde zdanie. Prosiłem o ostry, kanciasty tekst, a dostawałem jego wygładzoną wersję z zaokrąglonymi rogami, jakby ktoś w fabryce obawiał się, że się o moje zdanie skaleczę. To model, który dopisuje na końcu akapit zaczynający się od „Podsumowując”.

A Gemini? Gemini był dla mnie najbardziej nieprzewidywalny i przez to najciekawszy. Potrafił olśnić - wyprodukować zdanie tak celne, że przez chwilę siedziałem i myślałem, czy aby na pewno sam bym tak nie napisał. A pięć minut później, przy identycznym promptcie, gubił wątek, zmieniał temat albo odpowiadał z pewnością siebie na pytanie, którego nie zadałem. Jak genialny student, który jednego dnia pisze pracę życia, a drugiego myli nazwiska na egzaminie.

Dzień ósmy, czyli kiedy przestałem wierzyć w rankingi

Mniej więcej w pierwszym tygodniu zrozumiałem, że cały mój eksperyment opiera się na fałszywym założeniu. Myślałem, że mierzę modele. W rzeczywistości mierzyłem spotkanie tych modeli z moim konkretnym zadaniem, moim konkretnym gustem i moim konkretnym nastrojem danego dnia.

To brzmi jak oczywistość, ale w świecie testów AI jest to prawie herezja. Cały przemysł porównywania modeli opiera się na wierze, że da się ustawić je w jednym szeregu i powiedzieć: ten jest o siedem procent lepszy. Tabelki, benchmarki, wykresy słupkowe. Uwielbiamy to, bo daje poczucie, że chaos da się zamknąć w liczbie. Problem w tym, że moje zadanie - „napisz to tak, jak ja bym napisał” - nie ma obiektywnie poprawnej odpowiedzi. Jedynym sędzią byłem ja, a ja jestem sędzią kapryśnym, zmiennym i w poniedziałki rano wyjątkowo niesprawiedliwym.

Benchmark mówi wam, który model jest lepszy w rozwiązywaniu równań. Nie powie wam, z którym chce wam się pracować o dziewiątej rano z kubkiem stygnącej kawy. A to drugie decyduje o wszystkim.

Doszedłem do wniosku, którego się nie spodziewałem: wybór modelu to w dużej mierze wybór osobowości, z którą chcecie spędzać czas. Jedni wolą współpracownika, który nie dyskutuje i dowozi. Inni - takiego, który podrzuci wam myśl, na którą sami byście nie wpadli, nawet kosztem tego, że czasem wyjedzie w pole. To nie jest wybór techniczny. To wybór bliższy temu, jak dobieramy sobie ludzi.

Trzy maszyny, jeden prompt i miesiąc mojego życia, którego nie odzyskam

Co mnie naprawdę zaskoczyło

A teraz rzecz, dla której w ogóle warto było to robić. Trzy zaskoczenia, w kolejności narastającej niewygody.

Pierwsze: różnice między modelami były mniejsze, niż się spodziewałem, a różnice między moimi dniami - większe. Ten sam prompt, ten sam model, inny dzień - i czasem odpowiedź wydawała mi się genialna, a czasem miałem ochotę ją skasować. Potem przychodziła refleksja, że model był ten sam. Zmieniłem się ja. Mój próg tolerancji, moja cierpliwość, to, czy akurat chciało mi się czytać uważnie, czy tylko skanowałem tekst w poszukiwaniu pretekstu do narzekania. Przez trzydzieści dni najbardziej niestabilnym elementem tego eksperymentu byłem ja.

Drugie zaskoczenie było podstępniejsze. Zauważyłem, że z czasem zacząłem nieświadomie faworyzować model, który najszybciej robił dokładnie to, o co prosiłem. Czyli tego najbardziej uległego. Odpuszczałem tego, który podrzucał mi własne pomysły, bo pomysły wymagały ode mnie reakcji, oceny, myślenia. A ja, jak każdy człowiek, idę po linii najmniejszego oporu. I tu mnie zmroziło. Bo to znaczy, że narzędzie, które czyni mnie najwygodniejszym, niekoniecznie jest tym, które czyni mnie najlepszym. To są dwie różne rzeczy i nasza leniwa natura bardzo chce, żebyśmy je pomylili.

Trzecie zaskoczenie przyszło pod koniec i jest najmniej wygodne ze wszystkich. Pod koniec miesiąca złapałem się na tym, że zacząłem pisać prompty pod to, co według mnie dany model lubi. Nie żeby dostać najlepszą odpowiedź - żeby dostać odpowiedź, która da się [zdanie urwane - brak dokończenia] łatwo pochwalić. Zaczynałem służyć maszynie, zamiast jej używać. Dostosowywałem swoje pytania do jej mocnych stron, jak się dostosowuje rozmowę do humoru szefa. I w tym momencie zrozumiałem, że eksperyment skończył się testować modele, a zaczął testować mnie.

Narzędzie nie ma charakteru. Wy go mu dajecie

Mam to spisane w całości

Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.

Pobierz ebooki

Wrócę do tej iluzji osobowości, bo to jest sedno całej sprawy. Te trzy modele nie mają charakteru w żadnym sensownym znaczeniu tego słowa. Nie chcą niczego, nie czują niczego, nie pamiętają was między rozmowami, jeśli im tego świadomie nie włączyliście. To, co wzięliśmy za ich temperament, jest w ogromnej części tym, co sami do nich wnosimy.

Jeśli piszecie prompty uprzejme, ostrożne, pełne zastrzeżeń - dostaniecie uprzejme, ostrożne odpowiedzi, niezależnie od tego, który logotyp świeci w rogu ekranu. Jeśli piszecie konkretnie, bezczelnie, z własnym zdaniem - modele nagle stają się ostrzejsze, ciekawsze, bardziej „ich”. Przez większość testu myślałem, że badam, czym różnią się maszyny. Pod koniec wiedziałem już, że badam głównie, jakim jestem rozmówcą. Model to lustro z opóźnieniem. Oddaje wam wasz własny sposób myślenia, przepuszczony przez miliard cudzych zdań.

Dlatego ludzie kłócą się w internecie o to, który model jest najlepszy, z zapałem godnym sporów o religię albo o to, czy ananas pasuje do pizzy. Każdy ma rację i każdy się myli. Bo każdy testuje inne lustro innym sobą. Gość, który twierdzi, że dany model jest beznadziejny, często po prostu zadaje mu beznadziejne pytania i nie dopuszcza do siebie myśli, że to on jest zmienną.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Więc którego wybrać? Zła odpowiedź na dobre pytanie

Wiem, że część z was przewinęła do tego miejsca, żeby się dowiedzieć, który mam zainstalowany na stałe. Zdradzę, ale uprzedzam, że to będzie rozczarowujące: używam wszystkich trzech i wybór zależy od zadania, nastroju i tego, czy mam czas na dyskusję, czy tylko chcę, żeby ktoś mi coś szybko zrobił.

Kiedy piszę coś, co ma mieć ton i rytm, sięgam po tego, który najlepiej czuje melodię zdania. Kiedy muszę coś ogarnąć szybko i bezboleśnie, biorę pracusia. Kiedy utknąłem i potrzebuję kopa, nieoczywistego skojarzenia, zdania, które mnie zaskoczy - idę do tego nieprzewidywalnego, bo jego chaos bywa cenniejszy niż czyjaś przewidywalna solidność. To nie jest zdrada ani brak charakteru. To jest dokładnie to, co robimy z ludźmi: do różnych rzeczy wołamy różnych.

Największym błędem tej epoki jest szukanie jednego modelu, który będzie najlepszy we wszystkim. To tak, jakby szukać jednego przyjaciela, który jednocześnie da się zaprosić na imprezę, pomoże przy przeprowadzce i doradzi w sprawach serca. Taki człowiek nie istnieje i nikt przy zdrowych zmysłach go nie szuka. A przy maszynach dajemy się wciągnąć w pogoń za tym fantomem, bo marketing karmi nas obietnicą, że ten jeden, nowy, najnowszy, wreszcie będzie tym jedynym.

Trzydzieści dni, jeden prompt, trzy maszyny. Spodziewałem się tabelki ze zwycięzcą. Dostałem coś znacznie mniej efektownego i dużo bardziej użytecznego: świadomość, że przez cały czas oceniałem nie je, tylko siebie w ich towarzystwie. Że narzędzie, które wydaje się najlepsze, to zwykle to, które najwięcej wybacza mojemu lenistwu. I że jeśli chcę od tych maszyn więcej, muszę najpierw wymagać więcej od siebie.

Bo lustro można wymienić na lepsze, droższe, w ładniejszej ramie. Odbicie i tak zostaje to samo.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Który model AI jest najlepszy do pisania tekstów - Claude, GPT czy Gemini?

Autor nie wyłonił jednego zwycięzcy, bo każdy model sprawdzał się inaczej zależnie od zadania. Claude trafiał w ton i rytm zdania, GPT był szybki i solidny, lecz wygładzał ostre teksty, a Gemini bywał genialny lub zupełnie gubił wątek przy identycznym promptcie.

Czy benchmarki i rankingi modeli AI mówią, który naprawdę jest lepszy?

Według autora benchmarki mówią, który model lepiej rozwiązuje równania, ale nie powiedzą, z którym chce się pracować o dziewiątej rano - a to drugie decyduje o wszystkim. Zadanie w stylu 'napisz tak, jak ja bym napisał' nie ma obiektywnie poprawnej odpowiedzi i jedynym sędzią pozostaje kapryśny użytkownik.

Jak styl promptów wpływa na odpowiedzi modeli AI?

Autor zauważył, że uprzejme i ostrożne prompty dawały uprzejme i ostrożne odpowiedzi niezależnie od modelu, a konkretne i bezczelne pytania sprawiały, że modele stawały się ostrzejsze. Model opisywany jest jako lustro z opóźnieniem, które oddaje własny sposób myślenia użytkownika przepuszczony przez miliard cudzych zdań.

Czy warto używać kilku modeli AI jednocześnie zamiast jednego?

Autor używa wszystkich trzech modeli i dobiera je do zadania: po Claude sięga przy tekstach wymagających tonu i rytmu, po GPT gdy trzeba coś szybko i bezboleśnie ogarnąć, a po Gemini gdy potrzebuje nieoczywistego skojarzenia lub zdania, które go zaskoczy. Szukanie jednego modelu najlepszego we wszystkim porównuje do szukania jednego przyjaciela, który jednocześnie nadaje się na imprezę, do przeprowadzki i do rozmów o sercu.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 450 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›