Crawling neboli procházení je proces, při kterém robot objevuje URL a stahuje jejich obsah. Až poté může vyhledávač stránku zpracovat a rozhodnout o indexaci.
Co je crawling?
Googlebot navštěvuje známé URL, stahuje HTML a následuje odkazy. U nových nebo změněných stránek se frekvence návštěv liší podle webu, důležitosti URL a změn obsahu.
Jak roboti objevují stránky
Hlavními zdroji jsou interní a externí odkazy, XML sitemapy a dříve známé adresy. Osiřelá stránka bez interního odkazu se hůře objevuje a její význam není z architektury jasný.
Sitemapa pomáhá URL objevit, ale negarantuje procházení ani indexaci. Má obsahovat kanonické a indexovatelné stránky, které chcete ve vyhledávání.
Co crawling brzdí
- blokace v
robots.txt, - chyby serveru a dlouhé výpadky,
- smyčky nebo řetězce přesměrování,
- nekonečné kombinace filtrů a parametrů,
- odkazy bez skutečného atributu
href, - obsah dostupný až po interakci uživatele.
Úspěšné stažení stránky ještě nezaručuje indexaci ani pozici. Crawling je první technický předpoklad, nikoli výsledek SEO.