Skip to main content
All dokumentation

Crawl och kategorier

Varför en stor sajt crawlas kategori för kategori, varför den automatiska crawlen medvetet lämnar den ifred, och hur du skiljer en omappad sajt från en trasig.

Sajter crawlas på ett av två sätt, och vilket som gäller avgörs av storleken. Skillnaden är den absolut vanligaste källan till "ingenting händer".

Under 5 000 URL:er: den sköter sig själv

Den automatiska passningen tar hela kön och arbetar sig igenom den. Du behöver inte göra något, och mappningen handlar om mallar snarare än om att få sidor hämtade.

Över 5 000 URL:er: du väljer vad som spelar roll

Ovanför den gränsen startar den automatiska passningen aldrig, och sajten crawlas kategori för kategori.

Det är designen, inte ett fel. Att hämta hundratusen sidor innan någon sagt vilka delar av sajten som betyder något är dyrt för oss och oförskämt mot ditt ursprung. Så en stor sajt väntar tills du mappat något, och crawlar sedan det du mappade.

Följden fäller folk: på en stor sajt hämtar en crawl utan något mappat ingenting. Knappen fungerar, jobbet kör, och noll sidor läses — eftersom noll sidor valdes ut.

Mappning kräver ingen tidigare crawl

Det naturliga antagandet är att du måste crawla innan du kan kategorisera, och det är fel.

Kategoriförslagen härleds ur URL:ernas sökvägar, som upptäckten redan samlat in. En sajt som aldrig crawlats en enda gång kan mappas första dagen. På en sajt med 24 000 URL:er täcker ungefär ett dussin mönster typiskt sett så gott som allt.

Så när en stor sajt stått orörd i månader är första frågan inte "vad gick sönder" — den är "har någon mappat den".

De tre talen, och vad vart och ett inte är

Upptäckta — URL:er vi vet finns. Det största talet, och det säger ingenting om huruvida vi tittat på dem.

Mappade — URL:er tilldelade en kategori, det vill säga redo att crawlas. Det här är det som oftast saknas.

Crawlade — URL:er vi hämtat och lagrat data för. Bara dessa poängsätts.

Ett glapp mellan upptäckta och mappade är ett beslut du inte fattat än. Ett glapp mellan mappade och crawlade är arbete som pågår.

Upptäck fler lägger till URL:er, inte crawlar

"Upptäck fler" hittar nypublicerade URL:er och lägger till dem som upptäckta. De kommer in omappade, så ingenting hämtar dem förrän du tilldelar dem.

Räkna med att talen rör sig medan crawlen inte gör det. Det är funktionen som fungerar.

De två crawltyperna

En metadata-crawl läser head — titel, beskrivning, canonical, robots, strukturerad data. Det mesta av poängen läser detta.

En innehålls-crawl extraherar dessutom brödtexten: rubriker, text, bilder och interna länkar. Nyckelordshärledning, innehållskvalitet och länkanalys behöver alla den, så kör en innan du förväntar dig att de vyerna ska ha något att säga.

Läs vidare

Intern länkning