AI·Marta Kruk·29 września 2026·7 min czytania

Czy wpuszczać boty AI na stronę?

Boty AI na stronie - wpuszczać czy blokować

W logach serwera widzisz nazwy, których nikt Ci nie tłumaczył, i setki wejść bez jednego kliknięcia w ofertę. Boty AI na stronie zbierają treść dla modeli językowych i dla asystentów, którzy odpowiadają na pytania Twoich klientów. Blokada ma sens tam, gdzie treść sama jest towarem, a firma żyjąca z widoczności odcina sobie tą blokadą miejsce w odpowiedziach. Zanim dopiszesz pierwszą linijkę do pliku, przeczytaj, co tracisz przy każdym z tych ustawień!

Co warto wiedzieć przed zmianą robots.txt:

  • Dwa rodzaje robotów: jedne zbierają treść pod trening modeli, inne pobierają ją na potrzeby odpowiedzi udzielanej tu i teraz.
  • Plik działa na zaufanie: protokół RFC 9309 (2022), czyli umowa o czytaniu robots.txt, opiera się na dobrowolności właścicieli robotów.
  • Pozycje w Google zostają: ranking obsługuje Googlebot, więc reguła dla GPTBota nie dotyka wyników wyszukiwarki.
  • Wypisanie się działa do przodu: obejmuje przyszłe pobrania, a informacje o firmie krążą też po cudzych stronach.

Czym są boty AI i po co odwiedzają strony?

Roboty firm rozwijających sztuczną inteligencję pobierają treść stron po to, żeby nauczyć na niej model albo żeby podać ją w odpowiedzi na pytanie zadane w danej chwili. Każdy przedstawia się przy wejściu ciągiem znaków zwanym user-agent – po nim rozpoznasz go w logach i do niego adresujesz reguły w robots.txt.

Po co robot AI wchodzi na Twoją stronę:

  • Trening modelu: treść trafia do zbioru, na którym uczą się kolejne wersje modelu.
  • Indeks odpowiedzi: strona ląduje w bazie, z której asystent wybiera źródła i cytaty.
  • Pobranie na żądanie: ktoś wkleja Twój adres w rozmowie z asystentem, a robot wchodzi po treść w tej samej sekundzie.

Trzy tory dają trzy różne skutki, a jeden wpis w pliku ich nie rozdzieli. Googlebot chodzi po Twojej stronie niezależnie i reguły pisane dla robotów AI w ogóle go nie dotyczą.

Które boty AI odwiedzają polskie strony?

W logach polskich witryn najczęściej zobaczysz roboty trzech firm: OpenAI, Anthropic i Perplexity. Wśród stron chronionych przez Cloudflare GPTBot był najczęściej spotykanym robotem AI i odwiedził blisko 29 procent takich witryn (Cloudflare Radar, lipiec 2025). Boty AI na stronie widać jednak pod kilkunastoma nazwami, bo każda z tych firm prowadzi kilka robotów o różnych zadaniach.

Roboty, o których realnie decydujesz w robots.txt:

Bot Co robi Czy blokować
GPTBot Zbiera treść pod trening modeli OpenAI Tak, gdy treść jest Twoim produktem
ClaudeBot Zbiera treść pod trening modeli Anthropic Tak, w tych samych sytuacjach co GPTBota
PerplexityBot Buduje indeks, z którego Perplexity bierze cytowane źródła Blokada oznacza mniej cytowań w Perplexity

GPTBot i jego rola

Według dokumentacji OpenAI GPTBot zbiera treść pod trening modeli, a wyszukiwanie w ChatGPT obsługuje inny robot z własnym tokenem. Zablokowanie GPTBota odnosi się więc tylko do tego, czy Twoje teksty zasilą kolejne wersje modelu; zmiana reguły dla wyszukiwania działa po około 24 godzinach.

ClaudeBot, PerplexityBot i pozostałe

Anthropic prowadzi ClaudeBota jako robota treningowego i deklaruje stosowanie się do robots.txt oraz obsługę dyrektywy Crawl-delay, która rozrzedza wejścia w czasie (Claude Help Center, aktualizacja z 7 kwietnia 2026). Cytowania w wyszukiwaniu Claude’a obsługuje Claude-SearchBot, a wejścia na polecenie użytkownika – Claude-User.

PerplexityBot działa według innej logiki: dokumentacja Perplexity opisuje go jako robota budującego indeks pod odpowiedzi i cytowania, dlatego firma sama rekomenduje wpuszczenie go. Perplexity-User pobiera stronę wtedy, gdy pyta o nią człowiek, i według tej samej dokumentacji zwykle nie stosuje się do reguł z pliku.

Bot trenujący model a bot odpowiadający na pytanie

Różnica sprowadza się do momentu, w którym Twoja treść jest potrzebna. Robot treningowy pobiera ją raz, do zbioru dla kolejnej wersji modelu, a skutek zobaczysz dopiero za kilka miesięcy. Robot wyszukujący pobiera ją po to, żeby asystent podparł nią odpowiedź, którą właśnie składa.

Konsekwencje rozchodzą się w przeciwne strony. Rezygnacja z treningu chroni to, co uważasz za swoje, i nie kosztuje ani jednego wyświetlenia. Zamknięcie robota indeksującego odpowiedzi kosztuje tyle, ile warte są cytowania z Twojej domeny – dziś główny ślad prowadzący z rozmowy z asystentem na Twoją stronę.

Trening i cytowanie sterują osobnymi przełącznikami. Pierwszy z nich rozstrzyga, co oddajesz za darmo: gdy modele produkują opisy usług hurtowo, przewagę mają strony z własnymi pomiarami i zdjęciami z realizacji.

Jak zablokować boty AI w robots.txt?

Wystarczy zwykły plik tekstowy w katalogu głównym domeny, pod adresem twojadomena.pl/robots.txt. Wpisujesz w nim nazwę robota po User-agent i ścieżki, których ma nie pobierać, po Disallow; składnię opisuje Google Search Central (aktualizacja z 10 grudnia 2025). Zanim rozstrzygniesz, jak zablokować boty AI, otwórz ten adres i zobacz, co już tam stoi – w audytach zaczynam właśnie od tego pliku.

Blokada wszystkich botów AI

Trzy wpisy zamykają całą trójkę, każdy w osobnym bloku – taki zestaw wyłącza trening w OpenAI i Anthropic oraz obecność w cytowaniach Perplexity.

Wpisy do robots.txt:

  • GPTBot: linia 1 User-agent: GPTBot, linia 2 Disallow: /
  • ClaudeBot: linia 1 User-agent: ClaudeBot, linia 2 Disallow: /
  • PerplexityBot: linia 1 User-agent: PerplexityBot, linia 2 Disallow: /

Blokada wybiórcza – trening tak, cytowanie nie

W tym ustawieniu model może się uczyć na Twoich tekstach, a strona przestaje trafiać do cytowanych źródeł. Wystarczy jeden blok: para User-agent: PerplexityBot i Disallow: / zamyka mu drogę. Więcej wpisów nie potrzebujesz, bo robot bez własnej reguły wchodzi domyślnie.

GPTBot i ClaudeBot zostają wtedy z pełnym dostępem. Firmie usługowej częściej opłaca się odwrotnie: zostawić dwa pierwsze bloki z listy, skasować ten dla PerplexityBota i zamknąć trening przy otwartym cytowaniu.

Komu opłaca się blokada botów AI?

Zyskują firmy, dla których treść sama jest towarem. Wydawca z płatnym dostępem czy twórca kursów oddaje wtedy za darmo dokładnie to, na czym zarabia. Po drugiej stronie stoi lokalna usługa, gabinet czy firma B2B – tam treść pracuje jak wizytówka, a cytowanie w asystencie działa podobnie do polecenia od znajomego.

Blokada treningu zwykle się opłaca, gdy:

  • Sprzedajesz treść: artykuły, kursy i raporty za dostęp są Twoim towarem.
  • Masz dane, których nikt nie powtórzy: własne pomiary, badania i zestawienia zebrane wyłącznie u Ciebie.
  • Licencjonujesz zdjęcia lub bazy: darmowa kopia obniża wartość tego, co sprzedajesz odpłatnie.
  • Ruch przychodzi inną drogą: stali klienci i polecenia niosą sprzedaż, a wyszukiwanie jest dodatkiem.

Ustalenie, na czym Twoja firma zarabia i co z tego wynika dla robotów, wchodzi w pozycjonowanie w AI. Mogę przejrzeć Twoje logi i powiedzieć, które roboty wpuścić, a które zamknąć.

Czy blokada botów AI usuwa firmę z odpowiedzi modeli?

Zamknięcie robotów na własnej domenie nie wyprowadza firmy z odpowiedzi asystenta. Cloudflare sprawdził to w sierpniu 2025 roku: po skutecznej blokadzie Perplexity nadal odpowiadał na pytania o zamkniętą stronę, tylko mniej precyzyjnie i z innych źródeł. Blokada obowiązuje na Twojej domenie, a wiedza o firmie zostaje tam, gdzie już trafiła: w katalogach, na forach i w cudzych artykułach.

Wypisanie się z treningu też nie sięga wstecz, bo OpenAI i Anthropic odnoszą je do przyszłych pobrań. Jeśli nie wiesz, co dziś krąży o Twojej firmie poza Twoją stroną, skontaktuj się ze mną – sprawdzę, z jakich źródeł modele biorą informacje o Tobie.

Boty AI – jaką decyzję podjęłabym na Twoim miejscu?

Zaczynam od pytania, czy pieniądze przychodzą przez widoczność. Jeśli tak, roboty budujące indeksy odpowiedzi zostawiam otwarte, a zamykam wyłącznie treningowe i tylko wtedy, gdy mam materiał, którego nie chcę oddawać za darmo. Przy treści jako produkcie kolejność się odwraca, a koszt cytowań liczę zawczasu. Jednego nie da się cofnąć – to, co pobrano przed zmianą, zostaje w zbiorach i w cudzych tekstach. Dlatego wpis w robots.txt warto ustawić przed pierwszym pytaniem o Twoją branżę.

Najczęściej zadawane pytania o boty AI

Czy zablokowanie GPTBota wpływa na pozycje w Google?

Pozycje ustala Googlebot, a za treści dla Gemini odpowiada osobny token Google-Extended, który wyszukiwarką nie steruje (Google, dokumentacja robotów, aktualizacja z 12 czerwca 2026).

Jak sprawdzić, czy boty AI odwiedzają moją stronę?

Nazwy robotów zobaczysz w logach serwera albo w panelu sieci dostarczania treści (CDN), filtrując wejścia po polu user-agent. Nazwę łatwo podszyć, więc porównaj adres IP z oficjalnym plikiem, który każdy dostawca publikuje.

Czy blokada w robots.txt jest wiążąca dla botów AI?

Wiąże tych, którzy tak deklarują, więc sprawdź to u siebie: po zmianie pliku porównaj w logach deklarację robota z realnymi wejściami. Gdy wejścia zostają, przenieś ograniczenie na serwer lub zaporę aplikacyjną, bo sama linijka nie zatrzyma robota, który jej nie respektuje.

Czy warto blokować boty AI w sklepie internetowym?

W sklepie sensowniej zamknąć koszyk, konto klienta i pliki z ofertą dla porównywarek, a kategorie i karty produktów zostawić otwarte, bo to one odpowiadają za obecność asortymentu w odpowiedziach zakupowych.

Co zrobić, gdy bot AI mocno obciąża serwer?

Ogranicz liczbę żądań na serwerze lub zaporze aplikacyjnej (WAF), odpowiadaj kodem 429, czyli komunikatem „za dużo żądań”, a dla ClaudeBota ustaw Crawl-delay. Wpis User-agent: * z regułą Disallow: / zamyka przy okazji Googlebota, więc obciążenia nim się nie rozwiązuje.

Potrzebujesz tekstów, które pozycjonują i sprzedają?

Bezpłatna wycena