Sprawdziłem robots.txt 50 polskich serwisów: 21 blokuje boty AI
Pobrałem robots.txt 50 dużych polskich serwisów i sprawdziłem 13 botów AI. Kto blokuje GPTBota, kto ClaudeBota, kto nie blokuje nikogo i ile z tych stron stoi za Cloudflare.

👁 123 przeczytań
- Spośród 48 odczytanych plików robots.txt polskich serwisów, 21 (44%) blokuje co najmniej jednego bota AI według pomiaru z 5 października 2026.
- Najczęściej blokowanym botem jest GPTBot OpenAI (15 serwisów), ale aż 14 z tych serwisów jednocześnie wpuszcza OAI-SearchBot, czyli wyszukiwarkę ChatGPT.
- 19 z 50 serwisów działa za Cloudflare, lecz żaden nie korzysta z funkcji Bot Preference Sync udostępnionej 21 sierpnia 2026 wszystkim planom, w tym darmowemu.
Sprawdziłem pliki robots.txt 50 dużych polskich serwisów: 21 z 48, które dało się odczytać, blokuje co najmniej jednego bota AI. Najczęściej zamknięte drzwi ma GPTBot (15 serwisów), ale aż 14 z nich wpuszcza jednocześnie wyszukiwarkowego bota OpenAI. Pełny przewodnik po firmie, która filtruje dużą część tego ruchu, jest na stronie Cloudflare.
Pomiar z 5 października 2026
- Próba: 50 serwisów - 40 medialnych i technologicznych, 10 sklepów i ogłoszeń.
- Odczytane: 48 plików robots.txt (polskieradio.pl zwrócił 404, pracuj.pl odpowiedział 403).
- Blokuje co najmniej jednego bota AI: 21 z 48 (44%).
- Za Cloudflare: 19 z 50 według nagłówków i adresów IP.
- Żaden z 50 nie korzysta z automatycznej synchronizacji robots.txt Cloudflare (Bot Preference Sync).
Jak sprawdzałem
Napisałem krótki skrypt w Pythonie, który pobrał plik /robots.txt z każdego serwisu (najpierw z wersji z www, potem bez), rozbił go na grupy reguł i dla 13 botów AI sprawdził, czy serwis jawnie wpisał je z regułą Disallow: /. Liczyłem tylko jawne wpisy z nazwą bota. Ogólna reguła dla wszystkich (User-agent: *) nie wchodzi do wyniku, bo żaden z badanych serwisów nie blokuje nią całej strony.
Sprawdzane boty:
- OpenAI: GPTBot (trening), OAI-SearchBot (wyszukiwarka ChatGPT), ChatGPT-User (pobieranie stron na prośbę użytkownika);
- Anthropic: ClaudeBot, Claude-SearchBot, anthropic-ai;
- Perplexity: PerplexityBot;
- Google: Google-Extended (zgoda na użycie treści przez Gemini, nie wpływa na wyszukiwarkę);
- inne: CCBot (Common Crawl), Bytespider (ByteDance), Applebot-Extended, meta-externalagent (Meta), Amazonbot.
Przy okazji sprawdziłem, czy serwis stoi za Cloudflare - po nagłówku server: cloudflare albo cf-ray oraz po tym, czy adres IP domeny należy do opublikowanych zakresów Cloudflare. Ograniczenie jest jedno, ale ważne: robots.txt to tylko deklaracja. Serwis może nie mieć wpisu, a i tak blokować boty zaporą (Cloudflare robi to poza robots.txt), i odwrotnie - wpis nie zatrzyma bota, który go ignoruje.
Wynik: które boty są blokowane najczęściej
Ile z 48 serwisów jawnie blokuje danego bota (robots.txt, 5.10.2026)
Najciekawsza jest różnica między dwoma botami OpenAI. GPTBot zbiera treści do trenowania modeli i blokuje go 15 serwisów. OAI-SearchBot buduje indeks wyszukiwarki w ChatGPT i odpowiada za to, czy serwis pojawi się z linkiem w odpowiedzi - blokuje go tylko PAP. Czyli 14 z 15 wydawców mówi wprost: nie trenujcie na nas, ale cytujcie nas i podsyłajcie ruch. To ten sam podział, który Cloudflare od 15 września wprowadził w swoich ustawieniach jako „Disallow AI Training” - opisuję go w tekście jak ustawić boty AI w Cloudflare.
Drugie spostrzeżenie: Perplexity i Claude są blokowane rzadko (po 2-5 serwisów), mimo że Perplexity ma w branży najgorszą opinię. Polskie redakcje celują głównie w boty treningowe o dużym zasięgu (GPTBot, CCBot, Bytespider), a nie w asystentów, którzy linkują do źródła.
Tabela: 48 serwisów i ich reguły
„B” oznacza jawną blokadę całego serwisu dla danego bota. Kolumna „Razem” liczy wszystkie 13 sprawdzanych botów.
| Serwis | Cloudflare | GPTBot | ClaudeBot | Perplexity | Google-Ext. | CCBot | Meta | Razem /13 |
|---|---|---|---|---|---|---|---|---|
| pap.pl | - | B | B | B | - | B | B | 10 |
| android.com.pl | tak | B | B | - | B | B | B | 9 |
| wyborcza.pl | - | B | B | B | - | B | - | 8 |
| antyweb.pl | tak | B | B | - | B | B | B | 8 |
| bankier.pl | tak | B | - | - | B | B | - | 3 |
| pb.pl | tak | B | - | - | B | B | - | 3 |
| gazeta.pl | - | B | - | - | - | B | - | 3 |
| radiozet.pl | - | B | - | - | - | B | - | 3 |
| money.pl | - | B | - | - | - | B | - | 3 |
| ceneo.pl | - | - | B | - | - | - | - | 3 |
| onet.pl | - | - | - | - | - | - | B | 3 |
| businessinsider.com.pl | - | - | - | - | - | - | B | 3 |
| forbes.pl | - | - | - | - | - | - | B | 3 |
| fakt.pl | - | - | - | - | - | - | B | 3 |
| komputerswiat.pl | - | - | - | - | - | - | B | 3 |
| wp.pl | - | B | - | - | - | B | - | 2 |
| o2.pl | - | B | - | - | - | B | - | 2 |
| pudelek.pl | - | B | - | - | - | B | - | 2 |
| benchmark.pl | - | B | - | - | - | B | - | 2 |
| dobreprogramy.pl | - | B | - | - | - | B | - | 2 |
| tvn24.pl | - | B | - | - | - | - | - | 1 |
Bez żadnej jawnej blokady botów AI (27 serwisów): interia.pl, polsatnews.pl, rmf24.pl, rp.pl, natemat.pl, se.pl, wpolityce.pl, dorzeczy.pl, niezalezna.pl, tvp.info, gazetaprawna.pl, infor.pl, oko.press, newsweek.pl, spidersweb.pl, chip.pl, telepolis.pl, purepc.pl, gry-online.pl, allegro.pl, olx.pl, otodom.pl, x-kom.pl, mediaexpert.pl, empik.com, wykop.pl, filmweb.pl. Brak wpisu nie znaczy, że te serwisy wpuszczają wszystko - część z nich (na przykład rp.pl, se.pl, spidersweb.pl czy x-kom.pl) stoi za Cloudflare i może filtrować boty zaporą, czego z zewnątrz w robots.txt nie widać.
Wzorce wydawców: widać, kto ma wspólny plik
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
- Grupa Wirtualnej Polski (wp.pl, money.pl, o2.pl, pudelek.pl, dobreprogramy.pl, benchmark.pl) ma identyczny zestaw: GPTBot i CCBot. Wygląda to na jedną decyzję dla całej grupy.
- Serwisy Ringier Axel Springer Polska (onet.pl, businessinsider.com.pl, forbes.pl, fakt.pl, komputerswiat.pl) blokują Bytespider, meta-externalagent i Amazonbot, ale nie GPTBot. Axel Springer ma od 2023 roku umowę licencyjną z OpenAI - nie wiem, czy obejmuje polską spółkę, ale wzór pasuje.
- Agora różni się wewnątrz grupy: wyborcza.pl blokuje 8 botów, gazeta.pl 3, a radiozet.pl 3.
- PAP jest najbardziej restrykcyjna - 10 z 13 botów, w tym jako jedyna OAI-SearchBot, czyli wyszukiwarkę ChatGPT.
- Sklepy i ogłoszenia (allegro.pl, olx.pl, otodom.pl, x-kom.pl, mediaexpert.pl, empik.com) nie blokują nikogo. Dla sklepu bot AI to potencjalny klient: asystent zakupowy, który poleci produkt. Wyjątek to ceneo.pl, który zamyka drzwi botom Anthropic i ByteDance.
Cloudflare: 19 z 50 i prawie nikt nie używa jego robots.txt
19 z 50 serwisów odpowiada przez sieć Cloudflare. Mimo to tylko android.com.pl ma w robots.txt sekcję zarządzaną przez Cloudflare (stary mechanizm „Managed robots.txt”) i tylko dwa serwisy - android.com.pl i otodom.pl - publikują dyrektywę Content-Signal, którą Cloudflare promuje od 2025 roku jako sposób na rozróżnienie zgody na wyszukiwanie, trening i odpowiedzi AI. Żaden nie korzysta jeszcze z nowej funkcji Bot Preference Sync, którą Cloudflare udostępnił 21 sierpnia 2026 wszystkim planom, łącznie z darmowym.
Moja interpretacja: duże redakcje wolą trzymać robots.txt we własnych rękach, a blokady egzekwować zaporą. Dla małego bloga rachunek jest inny - automatyczna synchronizacja oszczędza ręcznego dopisywania nowych botów, których co kwartał przybywa.
Co z tego wynika dla małego wydawcy
- Blokowanie wszystkiego jest rzadkie. Nawet najbardziej restrykcyjne serwisy zostawiają otwarte boty wyszukiwarek AI. Odcięcie OAI-SearchBot, Claude-SearchBot czy PerplexityBot oznacza zniknięcie z odpowiedzi z linkiem.
- Trening to osobna decyzja. Jeśli nie chcesz, by modele uczyły się na Twoich tekstach, zablokuj GPTBot, ClaudeBot, CCBot, Google-Extended, Applebot-Extended i meta-externalagent - na wyszukiwarkę Google i Binga to nie wpływa.
- Robots.txt to prośba, nie zamek. Jeśli zależy Ci na egzekwowaniu, potrzebujesz zapory po stronie serwera albo usługi typu Cloudflare. Jak to ustawić krok po kroku, opisałem w tekście jak zablokować roboty AI na własnej stronie.
- Za blokadę nie dostaniesz pieniędzy, za zgodę może tak. Cloudflare 30 września uruchomił betę Pay Per Use, w której firmy AI płacą za faktyczne użycie treści - szczegóły w tekście Pay Per Use: czy blogerzy zarobią na AI.
Ograniczenia pomiaru
- To jednorazowy zrzut z 5 października 2026, około 9:00. Pliki robots.txt zmieniają się bez zapowiedzi.
- Liczyłem tylko pełne blokady (
Disallow: /). Kilka serwisów ma reguły częściowe dla wybranych katalogów - ich nie wliczałem. - Nie sprawdzałem blokad na poziomie zapory ani tego, czy boty faktycznie przestrzegają wpisów.
- Próba nie jest losowa - wybrałem największe i najbardziej znane serwisy w swoich kategoriach.
Źródła
- Własny pomiar: pliki robots.txt 50 serwisów, pobrane 5.10.2026.
- Cloudflare - zakresy adresów IPv4
- Cloudflare - Bot Preference Sync (21.08.2026)
- Cloudflare - Disallow AI Training i boty mieszane (15.09.2026)
- OpenAI - opis botów GPTBot, OAI-SearchBot i ChatGPT-User
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Ile polskich serwisów blokuje boty AI w robots.txt?
21 z 48 odczytanych serwisów, czyli 44%, jawnie blokuje co najmniej jednego bota AI. Pomiar przeprowadzono 5 października 2026 na próbie 50 dużych polskich serwisów - 40 medialnych i technologicznych oraz 10 sklepów i ogłoszeń.
Który bot AI jest najczęściej blokowany przez polskie strony?
Najczęściej blokowany jest GPTBot, zbierający treści do trenowania modeli OpenAI - blokuje go 15 serwisów. Na kolejnych miejscach są CCBot (14 serwisów) i Bytespider od ByteDance (11 serwisów).
Czy sklepy internetowe blokują boty AI w robots.txt?
Allegro, OLX, Otodom, x-kom, Mediaexpert i Empik nie blokują żadnego bota AI. Wyjątkiem jest Ceneo, które zamknęło drzwi botom Anthropic i ByteDance.
Czy zablokowanie GPTBot wpływa na widoczność w Google?
Nie, zablokowanie GPTBot nie wpływa na wyszukiwarkę Google ani Binga. GPTBot zbiera treści wyłącznie do trenowania modeli, a odrębny bot Google-Extended dotyczy zgody na użycie treści przez Gemini, nie przez wyszukiwarkę.
