Jak zablokować roboty AI na własnej stronie i kiedy naprawdę nie warto
Roboty zbierające treść do modeli dzielą się na trzy grupy i tylko jedna z nich nic Ci nie daje. Pokazuję, jak je rozdzielić w robots.txt, jak postawić twardą blokadę na serwerze i dlaczego zablokowanie wszystkiego bywa strzałem we własną stopę.

👁 151 przeczytań
- Blokowanie wszystkich robotów AI jednym wpisem w robots.txt to błąd, bo część z nich - ta budująca indeksy czatów - odsyła ruch z powrotem do źródła.
- Plik robots.txt nie ma mocy technicznej - to deklaracja, którą duzi operatorzy czytają, ale nachalne zbieracze podszywają się pod przeglądarkę i ją ignorują.
- Narzędzie omawiane w artykule sprawdza domenę i pokazuje status każdego z 26 robotów z listy, generując też gotowe reguły dla Apache i nginx.
Do logów własnego serwera zaglądam rzadko i za każdym razem wychodzi z tego to samo odkrycie: sporą część ruchu generują roboty, o których istnieniu nie miałem pojęcia. Część z nich indeksuje stronę pod wyszukiwarki, część zbiera tekst do trenowania modeli, część wchodzi dlatego, że ktoś wkleił mój link do czatu. To są trzy różne rzeczy i traktowanie ich jednym wpisem w pliku robots.txt jest błędem, który kosztuje ruch. Jeśli Twoja strona działa przez Cloudflare, zajrzyj też do przewodnika Cloudflare - ustawienia botów AI zmieniły się 15 września 2026.
Trzy rodzaje robotów
Pierwsza grupa zbiera treść do zbioru treningowego. Z Twojej perspektywy to transakcja jednostronna: oddajesz materiał i nie dostajesz w zamian ani odsyłacza, ani odwiedzin. Tu blokada ma sens ekonomiczny i to jest ta grupa, o której zwykle myślą ludzie mówiący, że chcą zablokować AI.
Druga grupa buduje indeks pod wyszukiwanie w czatach. Odpowiedź, którą dostaje użytkownik, zawiera odsyłacz do źródła, więc ruch potrafi wrócić. Zablokowanie tej grupy oznacza, że Twojej strony w tych odpowiedziach nie ma, a konkurencja jest. To jest realny koszt, nie teoria.
Trzecia grupa wchodzi na konkretny adres, bo poprosił o to człowiek w rozmowie. Blokowanie jej to blokowanie własnego czytelnika, tylko okrężną drogą.
robots.txt to prośba, nie zapora
Plik robots.txt nie ma żadnej mocy technicznej. To jest kartka na drzwiach z napisem, kto ma nie wchodzić. Duzi operatorzy deklarują, że ją czytają, i w praktyce widać, że czytają. Reszta świata niekoniecznie, a najbardziej nachalne zbieracze podszywają się pod zwykłą przeglądarkę i w ogóle nie podają się za roboty.
Jeśli zależy Ci na deklaracji, wystarczy robots.txt. Jeśli zależy Ci na skutku, potrzebujesz reguły po stronie serwera, która odrzuca połączenie na podstawie nagłówka identyfikującego klienta. W narzędziu do robotów AI generuję jedno i drugie: wpisy do robots.txt oraz gotowy fragment dla Apache i dla nginx. Przy tym drugim trzymaj się jednej zasady: zrób kopię pliku konfiguracyjnego przed wklejeniem, bo błąd składni w .htaccess kładzie całą stronę, a nie tylko blokowaną ścieżkę.
Pułapka, w którą wpada najwięcej osób
Google ma dwa osobne wpisy i mylenie ich potrafi wyciąć stronę z wyników wyszukiwania. Googlebot odpowiada za zwykłe indeksowanie i za pozycję w wyszukiwarce. Google-Extended dotyczy wyłącznie wykorzystania treści do trenowania modeli i nie ma wpływu na to, gdzie strona wypada w wynikach.
Zablokowanie Google-Extended jest bezpieczne, jeśli nie chcesz oddawać tekstów na trening. Zablokowanie Googlebota to samobójstwo. Widziałem oba wpisy pomylone w gotowcach krążących po internecie, więc zanim skopiujesz cokolwiek z forum, sprawdź, co dokładnie kopiujesz.
llms.txt, czyli odwrotność blokady
Osobny wątek to plik llms.txt: krótki spis w korzeniu domeny, który mówi modelom, czym jest ten serwis i co warto z niego zacytować. Nie jest standardem uzgodnionym z operatorami i nie ma mocy sprawczej. Jest za to czytany przez część narzędzi, kosztuje pięć minut i nie szkodzi. Jeśli zależy Ci na obecności w odpowiedziach czatów, warto go mieć. Jeśli ktoś sprzedaje Ci go jako gwarancję czegokolwiek, nie warto go słuchać.
Zacznij od sprawdzenia, co masz teraz
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Zanim cokolwiek zmienisz, zobacz stan wyjściowy. W narzędziu wpisujesz swoją domenę, a ono pobiera z niej robots.txt oraz llms.txt i pokazuje, jak wypada w nich każdy z dwudziestu sześciu robotów z listy: wpuszczony, zablokowany czy objęty regułą ogólną. Bardzo często okazuje się, że strona nie ma pliku robots.txt w ogóle, co oznacza pełną zgodę dla wszystkich.
Druga rzecz, którą warto zrobić po zmianie, to zajrzeć do własnych logów za tydzień. Lista robotów zmienia się szybciej niż jakikolwiek poradnik, operatorzy dokładają nowe nazwy bez ogłoszeń, a jedyne źródło prawdy o tym, kto naprawdę u Ciebie chodzi, siedzi na Twoim serwerze.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co zrobić z tymi, którzy się nie przedstawiają
Najbardziej uciążliwi zbieracze nie podają się za roboty. Przedstawiają się jako zwykła przeglądarka, więc żadna reguła oparta na nazwie ich nie zatrzyma. Tu zostają metody oparte na zachowaniu, a nie na deklaracji: ograniczenie liczby żądań z jednego adresu w jednostce czasu, blokada całych zakresów adresów należących do dostawców chmurowych, wreszcie usługi pośredniczące, które rozpoznają automaty po sposobie poruszania się po stronie.
Każda z tych metod ma koszt uboczny. Zbyt ostry limit potrafi odciąć czytelnika na łączu firmowym, a blokada zakresów chmurowych czasem wycina roboty wyszukiwarek, na których Ci zależy. Dlatego zaczynałbym od najprostszego kroku: zajrzyj do logów i zobacz, czy problem w ogóle istnieje. Bardzo często okazuje się, że ruch, który wygląda na inwazję robotów, to kilkadziesiąt żądań dziennie i nie warto pod to przebudowywać konfiguracji serwera.
Druga sprawa, o której łatwo zapomnieć: blokada nie działa wstecz. Materiał, który został zebrany wcześniej, jest już zebrany i żaden wpis w robots.txt tego nie cofnie. Blokada dotyczy przyszłości i tak trzeba o niej myśleć: nie jako o odzyskaniu czegoś, tylko jako o decyzji, co oddajesz od dziś.
Blokada nie jest decyzją techniczną, tylko biznesową. Warto ją podjąć świadomie, robotów po jednym, a nie jednym zamaszystym wpisem, który przy okazji odcina to, co przynosiło czytelników.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Czym różni się Googlebot od Google-Extended i który mogę zablokować?
Google-Extended dotyczy wyłącznie trenowania modeli i jego zablokowanie nie wpływa na pozycję strony w wynikach wyszukiwania. Zablokowanie Googlebota wycina stronę z wyników wyszukiwania - artykuł określa to wprost jako samobójstwo.
Czy robots.txt naprawdę blokuje roboty AI przed zbieraniem danych?
Nie - robots.txt to prośba bez mocy technicznej, którą szanują duzi operatorzy, ale ignorują najbardziej nachalne zbieracze podszywające się pod zwykłą przeglądarkę. Skuteczna blokada wymaga reguły po stronie serwera odrzucającej połączenie na podstawie nagłówka identyfikującego klienta.
Co to jest plik llms.txt i czy warto go dodać do swojej strony?
To krótki plik w korzeniu domeny informujący modele, czym jest serwis i co warto z niego cytować - nie jest uzgodnionym standardem i nie ma mocy sprawczej. Część narzędzi go czyta, a jego dodanie zajmuje pięć minut i nie powoduje żadnych negatywnych skutków.
Jak zablokować roboty, które nie podają się za roboty?
Roboty ukrywające się pod nazwą zwykłej przeglądarki można próbować zatrzymać przez limit żądań z jednego adresu, blokadę zakresów adresów chmurowych lub usługi rozpoznające automaty po zachowaniu. Każda z tych metod ma efekty uboczne - zbyt ostry limit może odciąć czytelnika na łączu firmowym, a blokada zakresów chmurowych czasem wycina też roboty wyszukiwarek.



