› Przez ostatni miesiąc wrzucałem te same zadania do ośmiu chatbotów: rozpisanie artykułu na 2000 słów, streszczenie raportu PDF, przepisanie maila z chłodnego na ludzki ton i prosty research z podaniem źródeł.
› Różnice nie są kosmetyczne - jedne modele trzymają kontekst przez dziesięć wiadomości, inne gubią wątek po trzeciej i zaczynają zmyślać.Oceny poniżej to moja subiektywna nota /10, nie wynik zewnętrznego benchmarku.
› Liczę w nich jakość pisania po polsku, trzymanie się instrukcji i to, czy model przyznaje się do niewiedzy zamiast konfabulować.
› Oto pierwsza trójka i kto powinien sięgnąć po co.#ModelMoja ocena1Claude9.4/10recenzja →2ChatGPT9.2/10recenzja →3Gemini8.8/10recenzja →4Grok8.3/10recenzja →5Kimi8.3/10recenzja →6Llama8.2/10recenzja →7Qwen8.2/10recenzja →8DeepSeek8.1/10recenzja →Oceny to moja subiektywna nota (skala /10) na podstawie testów, nie wynik zewnętrznego benchmarku.