AI Search a GEO

AI crawlery na webu: jak nastavit přístup pro vyhledávání a trénování

Robots.txt určuje, které crawlery mohou číst váš web. U AI služeb je ale třeba rozlišovat vyhledávací a tréninkové user-agenty, protože nemají stejný účel.

Reálná ocelová brána do technického archivu s jednou vědomě otevřenou kobaltovou trasou.
Přístup nastavujte podle účelu crawleru: vyhledávání, trénování modelů nebo načtení na žádost uživatele.

Firma může chtít zpřístupnit obsah pro vyhledávání v AI a současně nepovolit sběr pro trénování. AI crawlery proto neposuzujte jako jednu skupinu. V robots.txt zachyťte rozhodnutí pro konkrétní účel.

K čemu slouží jednotlivé AI crawlery

AI služby používají různé roboty a každý může mít jinou roli. V robots.txt je proto povolujte nebo blokujte po jednotlivých user-agentech:

  • OAI-SearchBot - OpenAI ho používá pro vyhledávání v ChatGPT.
  • GPTBot - OpenAI ho používá pro sběr obsahu k možnému zlepšování modelů.
  • ClaudeBot - Anthropic ho používá ke sběru obsahu, který může sloužit k tréninku modelů. Claude-User načítá obsah na žádost uživatele a Claude-SearchBot podporuje vyhledávání. Pravidla proto nastavujte pro každý user-agent zvlášť podle dokumentace Anthropicu.
  • PerplexityBot - vyhledávač Perplexity.
  • Google-Extended řídí použití obsahu pro trénování budoucích modelů Gemini a pro doplňování odpovědí o zdroje v Gemini Apps a Vertex AI. Přístup pro Google Search včetně AI Overviews a AI Mode se řídí pravidly pro Googlebot. Rozdíl vysvětluje přehled crawlerů Googlu.

Modelové nastavení: vyhledávání povolit, trénování odmítnout

Příklad řeší pouze dvojici crawlerů OpenAI. OAI-SearchBot má přístup kromě složky /neverejne/, GPTBot je blokovaný. Pro ostatní crawlery zůstává obecné pravidlo. Název složky je modelový.

User-agent: OAI-SearchBot
Disallow: /neverejne/

User-agent: GPTBot
Disallow: /

User-agent: *
Disallow: /neverejne/

Prázdné Disallow: neomezuje žádnou cestu v dané skupině. Disallow: / zakazuje celý web. Účely a samostatné nastavení popisuje dokumentace crawlerů OpenAI.

Když nová skupina nezachová původní omezení

Druhý modelový zápis ukazuje chybu: obecná skupina zakazuje složku, ale samostatná skupina crawleru toto omezení neobsahuje.

User-agent: *
Disallow: /neverejne/

User-agent: OAI-SearchBot
Disallow:

Samostatná skupina žádnou cestu nezakazuje. Nespoléhejte na automatické přičtení pravidel s hvězdičkou. Dokumentace interpretace robots.txt vysvětluje výběr skupiny; u další služby ověřte i její vlastní pravidla. Před úpravou uložte původní soubor a zachovejte existující omezení.

Kdy omezit přístup AI crawlerů a jak chránit neveřejný obsah

Pravidla pro vyhledávání a trénování modelů posuzujte samostatně. Robots.txt není zabezpečení citlivého nebo placeného obsahu; ten chraňte přístupovým oprávněním.

Po změně ověřte také odpověď serveru a případné blokování na CDN podle návodu na kontrolu přístupu crawlerů. Llms.txt tuto kontrolu nenahrazuje. Robots.txt není ochrana heslem ani záruka citace.

Časté otázky

Jak zjistím, jestli blokuji AI boty?

Otevřete vasedomena.cz/robots.txt a zkontrolujte pravidla Disallow pro konkrétní user-agenty. OAI-SearchBot a GPTBot posuzujte odděleně, protože nemají stejnou roli.

Mám AI boty pustit, nebo zablokovat?

Záleží na konkrétním user-agentu a cíli. OAI-SearchBot souvisí s vyhledáváním v ChatGPT, zatímco GPTBot s možným zlepšováním modelů. Nastavujte je odděleně.

Stačí crawlerům povolit přístup, aby mě AI citovala?

Ne. Povolený přístup umožní crawleru obsah načíst, pokud mu nebrání další technická překážka. Citaci nezaručuje; výběr zdrojů závisí na konkrétní službě a otázce.

SEO · PPC · AI Search

Nezávislý audit vašeho webu a kampaní

Podle potřeb vašeho webu vybereme oblast auditu: SEO, PPC, měření, obsah nebo AI Search. Dostanete stručný seznam doporučení v pořadí podle dopadu a plán na 30 dní.