Cloudflare zablokował boty AI na mojej stronie. Sprawdź swoją przed 15 września
W moim robots.txt siedziała blokada dziewięciu botów AI, której nigdy nie ustawiłem. Po sprawdzeniu okazała się sensowna, ale 15 września Cloudflare zmienia domyślne ustawienia i jedna kategoria potrafi wyciąć Googlebota.

👁 200 przeczytań
- Cloudflare automatycznie zablokował 9 botów treningowych AI (m.in. GPTBot, ClaudeBot, Google-Extended), jednocześnie pozostawiając otwarte boty wyszukiwania jak OAI-SearchBot czy PerplexityBot.
- Od 15 września 2026 roku Cloudflare zmieni domyślne ustawienia dla wszystkich stron, których właściciele nigdy świadomie nic nie skonfigurowali, blokując kategorię Training i Agent.
- Zablokowanie kategorii Training w panelu Cloudflare wyłącza Googlebot, Bingbot i Applebot w całości, co może usunąć stronę z wyników wyszukiwania Google.
W zeszłym tygodniu otworzyłem plik, do którego nie zaglądałem od miesięcy: własny robots.txt. To ten dokument, w którym strona mówi robotom, gdzie mogą wchodzić. Zwykle są tam trzy linijki. U mnie było kilkadziesiąt, a w środku lista dziewięciu zablokowanych botów, której nigdy nie ustawiłem.
Nad listą stoi komentarz: BEGIN Cloudflare Managed content. Czyli tę część mojego pliku pisze Cloudflare, nie ja.
Najpierw się wystraszyłem, potem przeczytałem uważnie
Pierwsza myśl była taka: serwis o sztucznej inteligencji zamknął drzwi przed sztuczną inteligencją. Usiadłem, sprawdziłem każdą pozycję po kolei i okazało się, że to nieprawda. Warto tę różnicę zrozumieć, bo prawie nikt jej nie robi, a ona decyduje o wszystkim.
Zablokowane są: GPTBot, ClaudeBot, Google-Extended, CCBot, meta-externalagent, Bytespider, Applebot-Extended, Amazonbot i wewnętrzny robot renderujący Cloudflare. Wszystkie dziewięć to roboty, które zbierają treść na trening modeli.
Otwarte zostały: OAI-SearchBot, Claude-SearchBot, PerplexityBot, ChatGPT-User, Perplexity-User, a także Googlebot, Bingbot i Applebot. Czyli wszystko, co szuka, cytuje i odsyła czytelnika. Do tego na górze pliku siedzi linijka Content-Signal: search=yes, ai-train=no, use=reference, będąca formalnym zastrzeżeniem praw na podstawie unijnej dyrektywy o prawie autorskim.
Innymi słowy: nie wypadłem z odpowiedzi asystentów. Wypadłem ze zbiorów treningowych. To jest dokładnie ta konfiguracja, którą sam bym wybrał, tylko że nie ja ją wybrałem.
Który bot co robi
| Robot | Do czego służy | Blokada oznacza |
|---|---|---|
| OAI-SearchBot | indeks wyszukiwania w ChatGPT | brak cytowań w ChatGPT |
| ChatGPT-User | pobranie strony, gdy użytkownik o nią poprosi | asystent nie wejdzie na Twój link |
| GPTBot | główny robot OpenAI, głównie trening | Twoje teksty poza danymi treningowymi |
| Claude-SearchBot | wyszukiwanie w Claude | brak cytowań w Claude |
| ClaudeBot | ogólny robot Anthropic | poza danymi treningowymi |
| Google-Extended | Gemini, osobno od wyszukiwarki | brak w Gemini, zero wpływu na pozycje w Google |
| CCBot | Common Crawl, otwarty zbiór treningowy | poza dziesiątkami zbiorów danych |
Zapamiętaj przede wszystkim wiersz z Google-Extended, bo tu ludzie robią najwięcej szkody sobie samym. Google-Extended to nie jest Googlebot. Jego zablokowanie nie rusza pozycji w wyszukiwarce ani o milimetr, a odblokowanie nie da Ci ani jednego wejścia więcej. To osobna sprawa, dotycząca wyłącznie Gemini.
A teraz rzecz naprawdę pilna: 15 września
Cloudflare zapowiedział, że od 15 września 2026 wchodzą nowe ustawienia domyślne. Ruch botów AI dzieli się na trzy kategorie: Search (indeksuje i cytuje), Agent (wchodzi na stronę, bo użytkownik właśnie o to poprosił) i Training (zbiera na trening). Nowa domyślna konfiguracja blokuje Training i Agent na stronach z reklamami, a Search zostawia otwarty.
Domyślne ustawienia obejmą nie tylko nowe domeny, ale też każdą istniejącą, w której właściciel nigdy świadomie niczego nie zapisał. Czyli ogromną większość.
I tu jest pułapka, o której trzeba wiedzieć, zanim się cokolwiek kliknie. Cloudflare stosuje wobec robotów wielozadaniowych regułę najbardziej restrykcyjną. Googlebot, Bingbot i Applebot robią jednocześnie Search i Training. Jeżeli zablokujesz kategorię Training, zablokujesz je w całości. Nie „częściowo”, nie „tylko od strony treningu”. Całkiem.
Przeczytaj to zdanie jeszcze raz, bo brzmi jak drobiazg techniczny, a jest jednym kliknięciem od wypisania własnej strony z Google.
Dlaczego to zaczyna mieć znaczenie akurat teraz
Co sam z tego zbudowałem
Osiem narzędzi, które powstały z problemów opisywanych na tym blogu - razem z tym, czego nie udało się dowieźć.
Rok temu machnąłbym ręką. Ktoś zapyta asystenta, dostanie odpowiedź, koniec historii. Dziś ta odpowiedź ma przypisy, a w przypisy ludzie klikają. Asystent przestał być ślepym zaułkiem i stał się kolejnym miejscem, z którego przychodzi ruch.
Do tego dochodzi rachunek, który liczę codziennie. Wygenerowanie tekstu wielkości artykułu kosztuje dziś od 0,0055 zł na najtańszym modelu do 0,4678 zł na najdroższym. Mediana ceny za punkt indeksu inteligencji to 63 grosze. Treści jest coraz więcej i jest coraz tańsza, więc jedyne, co zachowuje wartość, to bycie źródłem, na które ktoś się powołuje. Blokując roboty wyszukiwania, wypisujesz się właśnie z tej roli. Blokując same roboty treningowe, nie tracisz nic poza tym, że Twój tekst nie zasili cudzego modelu.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co zrobić dziś, w tej kolejności
Po pierwsze, wejdź na swoją stronę i dopisz na końcu adresu /robots.txt. Przeczytaj, co tam jest. Nie zakładaj, że wiesz, ja też zakładałem.
Po drugie, sprawdź, czy widzisz w tym pliku komentarz o zarządzanej treści od dostawcy CDN. Jeżeli tak, część Twojego pliku pisze ktoś inny i musisz wiedzieć, co dokładnie.
Po trzecie, zajrzyj do panelu Cloudflare, w sekcję AI Crawl Control, i podejmij decyzję świadomie, zamiast pozwolić, żeby 15 września podjęto ją za Ciebie. Ustawiaj robot po robocie, nie całymi kategoriami, dokładnie z powodu opisanego wyżej.
U siebie zostawiam to, co jest, bo po sprawdzeniu okazało się rozsądne. Ale zostawiam świadomie i z datą w kalendarzu, a nie dlatego, że nigdy nie zajrzałem.
Najgorsze decyzje w internecie to nie te złe. To te, których nikt nie podjął, a które działają latami, bo nikt nie sprawdził.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Co robi Cloudflare z botami AI na mojej stronie bez mojej wiedzy?
Cloudflare może samodzielnie dopisywać do pliku robots.txt sekcję oznaczoną komentarzem 'BEGIN Cloudflare Managed content', blokując wybrane boty treningowe. Właściciel strony może to sprawdzić, wpisując w przeglądarce adres swojej domeny z dopiskiem /robots.txt.
Czy zablokowanie Google-Extended zaszkodzi pozycji mojej strony w wyszukiwarce Google?
Nie, zablokowanie Google-Extended nie wpływa na pozycje w wyszukiwarce ani o milimetr. Ten bot dotyczy wyłącznie Gemini i jest osobnym robotem niezwiązanym z Googleboten indeksującym strony.
Ile kosztuje wygenerowanie tekstu przez AI i dlaczego to ma znaczenie dla właścicieli stron?
Koszt wygenerowania tekstu wielkości artykułu wynosi od 0,0055 zł na najtańszym modelu do 0,4678 zł na najdroższym. Ponieważ treści jest coraz więcej i jest coraz tańsza, jedyną wartościową pozycją pozostaje bycie źródłem, na które cytujące asystenty się powołują.
Co powinienem zrobić w panelu Cloudflare przed 15 września 2026?
Należy wejść do sekcji AI Crawl Control i ustawić reguły robot po robocie, a nie całymi kategoriami. Blokowanie całej kategorii Training wyłącza również Googlebot, Bingbot i Applebot, bo Cloudflare stosuje wobec robotów wielozadaniowych regułę najbardziej restrykcyjną.



