Slovník
robots.txt
Textový soubor v kořeni webu, který robotům říká, kam smí a kam ne. Pokyny jsou určené i AI crawlerům, které tento soubor respektují.
robots.txt je obyčejný textový soubor umístěný v kořeni domény (například svaton.cz/robots.txt), který robotům dává pokyny, které části webu smí procházet a které ne. Soubor však technicky nezabrání přístupu robotovi, který jeho pravidla nerespektuje.
Jak funguje
Pracuje s pravidly User-agent (pro kterého robota platí), Disallow (kam nesmí) a Allow (výjimka). Klasicky se jím řešilo, aby roboty nemrhaly kapacitou na nesmyslné stránky - filtry, košík, interní vyhledávání.
Nová role v éře AI
Tentýž soubor dnes řídí i AI crawlery. Každý user-agent ale může mít jiný účel. U OpenAI například OAI-SearchBot souvisí s vyhledáváním, zatímco GPTBot s možným zlepšováním modelů. Pravidla proto nastavujte po jednotlivých crawlerech, ne jedním zákazem pro všechny.
Co zkontrolovat: při nálezu blokování v robots.txt nejprve zjistěte, kterých URL se pravidlo týká. Blokování filtrů či interního vyhledávání může být záměrné; důležité obsahové stránky je třeba posoudit samostatně.
Časté otázky
Skryje robots.txt stránku z Google?
Ne spolehlivě. Disallow jen zabrání procházení obsahu, stránka se i tak může objevit ve výsledcích bez popisu. Na skutečné vyloučení z indexu slouží značka noindex, ne robots.txt.
Musí mít web robots.txt?
Nemusí, ale mít ho je dobrá praxe. Aspoň by měl odkazovat na sitemapu a vědomě řešit přístup robotů včetně AI crawlerů.
Nezávislý audit
Zjistěte, co ve vašem marketingu zlepšit.
Podle potřeb vašeho webu vybereme oblast auditu: SEO, PPC, měření, obsah nebo AI Search. Dostanete až 10 doporučení podle dopadu a plán na 30 dní.