Czat odpowiedział, więc AI Cię widzi? Jak naprawdę sprawdzić, czy blokujesz boty AI
Po moim wystąpieniu na Let’s Grow w Poznaniu padło pytanie z sali: jak sprawdzić, czy blokujemy boty AI na swojej stronie?
Najczęściej słyszę dwie odpowiedzi. „Mam czysty robots.txt”. „Wkleiłem link w ChatGPT i odpowiedział”. Obie brzmią uspokajająco i obie potrafią wprowadzić w błąd. Robots.txt to jedna z kilku bramek, przez które bot przechodzi, zanim zobaczy Twoją treść, a część pozostałych ustawił ktoś za Ciebie: hosting, Cloudflare, wtyczka bezpieczeństwa albo agencja, która kiedyś stawiała stronę. Chat z kolei potrafi opowiedzieć o stronie, na którą w ogóle nie wszedł.
Da się to sprawdzić porządnie i bez błędów. Część w kwadrans, samemu, a część tylko z logami serwera.
Najpierw ustal, o którego bota pytasz
„Bot AI” to skrót myślowy. Każda duża firma AI ma kilka botów do różnych zadań i każdego blokujesz osobno:
| Rodzaj | Przykłady | Po co wchodzi | Co zmienia blokada |
|---|---|---|---|
| treningowe | GPTBot, ClaudeBot, Google-Extended | zbierają treści do uczenia modeli | Twoje teksty nie trafią do przyszłych modeli |
| wyszukiwawcze | OAI-SearchBot, Claude-SearchBot, PerplexityBot | budują indeks, z którego chat cytuje i linkuje | znikasz z odpowiedzi wyszukiwarki danego chatu |
| na prośbę użytkownika | ChatGPT-User, Claude-User, Perplexity-User | wchodzą, gdy ktoś wklei link albo chat sięga po stronę w trakcie rozmowy | chat nie przeczyta strony, o którą pyta klient |
Przy trzecim rodzaju robots.txt bywa bezradny. OpenAI i Perplexity piszą w dokumentacji, że skoro pobranie zlecił człowiek, reguły z robots.txt mogą tych botów nie obowiązywać. Anthropic deklaruje, że Claude-User się do nich stosuje.
Z tej tabeli biorą się dwie pomyłki, które widuję najczęściej.
Pierwsza dotyczy GPTBota. Właściciel serwisu go blokuje i myśli, że zniknął z ChatGPT. Zniknął z materiału do trenowania, ale przyszłych modeli OpenAI. Za obecność w wyszukiwarce ChatGPT odpowiada OAI-SearchBot, a OpenAI traktuje te ustawienia jako niezależne.
Druga dotyczy Google-Extended. Blokada miała wyjąć stronę z AI Overviews, tylko że Google-Extended steruje czymś innym: trenowaniem modeli Gemini i korzystaniem z Twoich treści w aplikacji Gemini. Na wyniki wyszukiwania, w tym AI Overviews i tryb AI, nie wpływa. Do tego celu od 31 sierpnia 2026 służy osobny przełącznik w Search Console: wyjmuje stronę z odpowiedzi AI w wyszukiwarce i nie rusza zwykłych wyników.
Zanim więc cokolwiek zablokujesz, zdecyduj, na czym Ci zależy: na obecności w odpowiedziach chatów czy na ochronie treści przed trenowaniem. Obie decyzje da się podjąć osobno.
Bramki, przez które przechodzi bot

Bramki na drodze bota AI. Pomarańczowe zatrzymują bota po cichu: blokadę zobaczysz dopiero w logach serwera.
Po drodze do Twojej treści bot AI mija kilka warstw i każda może go zatrzymać:
- CDN, najczęściej Cloudflare. Stoi przed serwerem i od lipca 2026 ma osobne ustawienia dla botów wyszukiwawczych, treningowych i działających w imieniu użytkownika.
- WAF, czyli zapora aplikacji. Tu siedzą reguły po nazwie bota, testy „czy jesteś człowiekiem” (bot bez przeglądarki ich nie przejdzie), blokady ruchu spoza Polski i limity zapytań.
- Robots.txt. Reguły, o które prosisz boty. Te, które się do nich stosują, zawrócą. Pozostałych plik nie zatrzyma.
- Hosting i CMS. Firewall hostingu, blokady adresów z chmur (AWS, Google Cloud, Azure), z których działa większość botów AI, odpowiedź 429 „za dużo zapytań”, wtyczki w rodzaju „blokuj AI”.
Bot, który przejdzie przez wszystkie, wciąż może dostać stronę blokady z kodem 200 albo treść dokładaną dopiero przez JavaScript, którego większość botów AI nie wykonuje. Renderowaniu poświęciłem osobny przewodnik po JavaScript SEO.
Jedna bramka stoi poza Twoim serwerem. Jeśli budujesz widoczność przez publikacje na cudzych portalach, sprawdź, czy te portale wpuszczają boty, z których korzystają chaty. Kupujesz artykuł na portalu, który blokuje Bingbota, a na indeksie Binga opiera się Copilot. Płacisz wtedy za widoczność, której AI nie zobaczy.
Co sprawdzisz sam w kwadrans
1. Robots.txt
Dopisz do adresu strony /robots.txt i przeczytaj plik. Szukaj Disallow: / pod GPTBot, ClaudeBot, OAI-SearchBot, PerplexityBot i pokrewnymi. Uważaj na ogólną regułę User-agent: * z blokadą, bo obejmuje wszystkie boty naraz. Jeśli domena stoi za Cloudflare, przejrzyj też początek pliku: Cloudflare potrafi dopisać tam własny blok reguł, oznaczony komentarzem z jego nazwą, albo linie Content-signal.
Reguły dla każdego rodzaju bota osobno ustawisz w darmowym generatorze robots.txt, który ma gotowe ustawienia pod widoczność w AI.
2. Cloudflare
Jeśli korzystasz z Cloudflare, otwórz ustawienia zabezpieczeń domeny (Security, Settings) i w filtrze wybierz ruch botów (Bot traffic). Od lipca 2026 boty AI są tam podzielone na trzy kategorie: Search, Training i Agent. Każdą można wpuścić, zablokować albo zablokować tylko na stronach z reklamami. Po zmianach z 15 września sprawdź dwie rzeczy.
Po pierwsze, blokada w kategorii Training odcina teraz także Googlebota, Bingbota i Applebota. Cloudflare zalicza je do crawlerów mieszanych, które zbierają dane i do wyszukiwarki, i do AI. Na swoim blogu pisze wprost, że opcja Block zatrzyma Googlebota. Jeśli chcesz zablokować sam trening, wybierz nową opcję Disallow AI Training.
Po drugie, jeśli domena miała włączone stare ustawienie „Block AI bots” (od lipca 2025 było domyślne dla nowo dodawanych domen), 15 września Cloudflare przestawił ją na Disallow AI Training i zablokował boty działające w imieniu użytkownika na stronach z reklamami. Na takiej stronie ChatGPT nie przeczyta treści, nawet gdy klient wklei link.
Ustawienia dla pojedynczych botów znajdziesz w zakładce AI Crawl Control.
3. Sygnały w kodzie strony i w Search Console
Otwórz źródło strony i poszukaj noindex oraz nosnippet w znaczniku meta robots. Te same dyrektywy mogą przychodzić w nagłówku odpowiedzi X-Robots-Tag, którego w kodzie nie widać. Często zostają po starej wersji strony albo po testach. W Search Console zajrzyj do ustawień i sprawdź, czy przełącznik generatywnej AI w wyszukiwarce nie stoi na wykluczeniu.
4. Test w czacie z haczykiem
Wklej adres podstrony do ChatGPT albo Claude’a i zapytaj o coś, czego nie da się zgadnąć: cenę, zdanie z opisu, coś, co zmieniłeś wczoraj. Pytanie „o czym jest ta strona?” niczego nie sprawdza. Chat odpowie na nie z pamięci modelu, z indeksu wyszukiwarki albo z własnej kopii strony sprzed tygodni, nawet jeśli dziś jego bot nie ma wstępu.
Udany test sprawdza przy tym jeden rodzaj bota: ten na prośbę użytkownika. O wyszukiwawczym i treningowym nie mówi nic.
5. Wyłączony JavaScript
W przeglądarce otwórz narzędzia deweloperskie, wyłącz JavaScript i odśwież najważniejszą podstronę, na przykład kartę produktu albo ofertę. Co zniknęło, tego większość botów AI nie widzi. Na mojej stronie testowej GPTBot i ClaudeBot przez 80 dni praktycznie nie wykonywały JavaScriptu (jeden płytki wyjątek u GPTBota).
Czego sam nie sprawdzisz
Tej części nie zobaczysz z przeglądarki, bo nie jesteś botem.
Ciche blokady
Zapora albo hosting mogą przepuszczać Ciebie i blokować prawdziwego GPTBota, który przychodzi z adresów chmurowych i bez przeglądarki. Ty widzisz działającą stronę, bot dostaje 403 albo 429. Taką blokadę widać wyłącznie w logach serwera albo w panelu, który pokazuje, kto dostał jaki kod odpowiedzi.
Przebierańcy
W logach bot przedstawia się nazwą, którą sam sobie wpisał. Na mojej stronie testowej 27 z 30 wizyt „PerplexityBota” i 24 z 27 wizyt „ChatGPT-User” pochodziło od kogoś innego: z puli tanich serwerów, które przy okazji szukały kluczy dostępowych do serwera (szczegóły na jsseo.dev, po angielsku). W całym ruchu botów AI podróbek było co najmniej 7%. Badanie HUMAN Security pokazuje podobny rząd wielkości: fałszywe było 5,7% żądań podpisanych nazwami 16 znanych botów AI, a przy ChatGPT-User co szóste.
Przebierańców jest więc niewielu w skali całości, za to skupiają się tam, gdzie najbardziej chcesz ufać liczbom. W moich danych Cloudflare twardo weryfikował tylko Googlebota, a na darmowym planie boty AI rozpoznaje wyłącznie po nazwie, więc fałszywy Perplexity przechodził bez przeszkód. Prawdziwego bota od podróbki odróżnisz dopiero po adresie IP sprawdzonym z listami, które publikują dostawcy. Jak to policzyłem i co z tego wynika dla raportów, opisałem w osobnym tekście o przebierańcach.
Czy bot przestrzega reguł
Z logów tego nie wyczytasz. Na mojej stronie testowej GPTBot przez 15 dni ani razu nie pobrał robots.txt, a mimo to chodził po treści (dane na jsseo.dev). Możliwe, że czyta reguły centralnie, z innych adresów, więc brak wpisu w logach niczego nie przesądza. Zgodność sprawdza się eksperymentem: blokujesz fragment strony i obserwujesz, czy bot przestał tam zaglądać.
Do czego trafiła Twoja treść
Popularne ustawienie „wpuść wyszukiwarkę ChatGPT, zablokuj trening” zakłada, że strony dla wyszukiwarki pobiera OAI-SearchBot. Na mojej świeżej domenie testowej wszystkie jego wizyty z pierwszych pięciu dni (10 z 10) dotyczyły samego robots.txt, a podstrony w tym czasie pobierał GPTBot, 83 razy (dane na jsseo.dev). Zgadza się to z dokumentacją OpenAI: gdy oba boty mają wstęp, jedno pobranie może posłużyć obu celom, więc w logach widać tylko jednego z nich.
Od kiedy
Jeśli widoczność w chatach spadła, liczy się data. Ktoś zmienił ustawienia zapory, hosting wprowadził limit, Cloudflare 15 września przestawił ustawienia domen, a Google 31 sierpnia dodał przełącznik AI w Search Console. Bez historii logów nie połączysz spadku z przyczyną.
Wszystkie te pytania wymagają logów serwera i dostępu do konfiguracji: Cloudflare, zapory, hostingu, CMS-a. Da się to zrobić samemu, tylko że to kilka godzin analizy.
Dostęp to pierwszy z czterech problemów
Na Let’s Grow pokazywałem cztery miejsca, w których AI gubi treść. Dostęp: bot nie wszedł. Renderowanie: wszedł, ale nie wykonał JavaScriptu. Parsowanie: zobaczył treść, ale źle ją odczytał, jak model, który cenę hostingu 130 zł przeczytał jako 1300 zł, bo grosze były zapisane w indeksie górnym. Retrieval: nie ma Cię w indeksie, z którego korzysta dany chat. Od dostępu zależą pozostałe trzy: bot, który nie wszedł, niczego nie wyrenderuje ani nie odczyta.
Jeśli wolisz tego nie robić sam
Buduję narzędzie, które zrobi za Ciebie część tych testów. Jeśli chcesz, żebym sprawdził Twoją stronę jako jedną z pierwszych, odezwij się do mnie na LinedInie. A jeśli potrzebujesz pełnego obrazu od razu, bez czekania, z analizą logów i konfiguracji, napisz do mnie. To zakres audytu dostępu botów AI.
