Slovník

robots.txt

Textový soubor v kořeni webu, který robotům říká, kam smí a kam ne. Pokyny jsou určené i AI crawlerům, které tento soubor respektují.

robots.txt je obyčejný textový soubor umístěný v kořeni domény (například svaton.cz/robots.txt), který robotům dává pokyny, které části webu smí procházet a které ne. Soubor však technicky nezabrání přístupu robotovi, který jeho pravidla nerespektuje.

Jak funguje

Pracuje s pravidly User-agent (pro kterého robota platí), Disallow (kam nesmí) a Allow (výjimka). Klasicky se jím řešilo, aby roboty nemrhaly kapacitou na nesmyslné stránky - filtry, košík, interní vyhledávání.

Nová role v éře AI

Tentýž soubor dnes řídí i AI crawlery. Každý user-agent ale může mít jiný účel. U OpenAI například OAI-SearchBot souvisí s vyhledáváním, zatímco GPTBot s možným zlepšováním modelů. Pravidla proto nastavujte po jednotlivých crawlerech, ne jedním zákazem pro všechny.

Co zkontrolovat: při nálezu blokování v robots.txt nejprve zjistěte, kterých URL se pravidlo týká. Blokování filtrů či interního vyhledávání může být záměrné; důležité obsahové stránky je třeba posoudit samostatně.

Časté otázky

Skryje robots.txt stránku z Google?

Ne spolehlivě. Disallow jen zabrání procházení obsahu, stránka se i tak může objevit ve výsledcích bez popisu. Na skutečné vyloučení z indexu slouží značka noindex, ne robots.txt.

Musí mít web robots.txt?

Nemusí, ale mít ho je dobrá praxe. Aspoň by měl odkazovat na sitemapu a vědomě řešit přístup robotů včetně AI crawlerů.

Nezávislý audit

Zjistěte, co ve vašem marketingu zlepšit.

Podle potřeb vašeho webu vybereme oblast auditu: SEO, PPC, měření, obsah nebo AI Search. Dostanete až 10 doporučení podle dopadu a plán na 30 dní.