Googlebot avslöjat: så fungerar crawling, hämtning och bytegränser
Google

Googlebot avslöjat: så fungerar crawling, hämtning och bytegränser

I korthet

Google har publicerat en detaljerad genomgång av hur Googlebot och dess centraliserade crawlningsinfrastruktur faktiskt fungerar, med särskilt fokus på bytegränser per URL. Artikeln klargör att Googlebot inte är ett enda program utan en gemensam plattform som används av ett flertal Google-tjänster, och att HTML-dokument hämtas upp till maximalt 2 MB per URL. Dessa tekniska detaljer har direkta konsekvenser för hur webbplatsers innehåll indexeras och bör beaktas av alla som arbetar med SEO.

Nyckelpunkter

  • Googlebot är inte ett enskilt program utan ett samlingsnamn för Googles centraliserade crawlningsplattform, som också används av tjänster som Google Shopping och AdSense under egna crawler-namn.
  • För HTML-sidor gäller en bytegräns på 2 MB per URL, inklusive HTTP-rubriker, vilket innebär att allt innehåll efter denna gräns helt ignoreras och varken hämtas, renderas eller indexeras.
  • PDF-filer har en betydligt högre gräns på 64 MB, medan crawlers som inte anger en specifik gräns som standard hämtar upp till 15 MB oavsett innehållstyp.
  • Varje extern resurs som refereras i HTML-koden, till exempel JavaScript- och CSS-filer, hämtas separat av Web Rendering Service (WRS) och har sin egen 2 MB-räknare fristående från modersidan.
  • WRS renderar JavaScript och CSS på ett sätt som liknar en modern webbläsare, men opererar tillståndslöst och rensar lokal lagring samt sessionsdata mellan varje förfrågan.
  • Ordningen på element i HTML-dokumentet spelar roll: kritiska element som metataggar, kanoniska taggar och strukturerad data bör placeras högt upp i koden för att säkerställa att de hämtas innan bytegränsen nås.

Analys

En av de viktigaste insikterna i Googles genomgång är distinktionen mellan Googlebot som varumärke och den faktiska tekniska infrastrukturen. Det som syns i serverloggar som 'Googlebot' representerar i praktiken en stor, gemensam crawlningsplattform som betjänar många olika Google-produkter. Detta innebär att förståelse för denna infrastruktur är relevant inte bara för organisk sökning utan för ett bredare ekosystem av Googles tjänster, och att inställningar och gränser tillämpas konsekvent på plattformsnivå snarare än per produkt.

2 MB-gränsen för HTML är den tekniska detalj som har störst praktisk inverkan för SEO-arbetet. Det handlar inte om att Google avvisar sidor som överstiger gränsen, utan om att hämtningen avbryts exakt vid 2 MB och att den nedladdade delen behandlas som om det vore hela filen. Bytes som hamnar efter gränsen existerar helt enkelt inte ur Googlebots perspektiv. För de allra flesta webbplatser är detta ingen begränsning, men för sidor med stora mängder inline-kod, base64-kodade bilder inbäddade i HTML eller massiva navigationsstrukturer kan gränsen få reella konsekvenser för vad som faktiskt indexeras.

Att externa resurser hanteras separat med egna bytegränser är en viktig nyans som påverkar hur man bör tänka kring webbplatsarkitektur. Att flytta tung CSS och JavaScript till externa filer innebär inte bara bättre kodorganisation utan är tekniskt fördelaktigt ur crawlningsperspektiv, eftersom det frigör utrymme i det primära HTML-dokumentet för det innehåll och de metadata som har störst betydelse för indexering. WRS hämtar dessa externa filer med Googlebot och tillämpar samma gräns per fil, men de räknas alltså inte mot modersidarns kvot.

WRS tillståndslösa karaktär är ett område som kräver uppmärksamhet för webbplatser som förlitar sig på dynamiskt innehåll. Eftersom WRS rensar lokal lagring och sessionsdata mellan förfrågningar kan JavaScript-beroende element som är knutna till användarstatus, cookies eller sessionstillstånd tolkas felaktigt eller inte alls av Googles system. Webbplatser med personaliserat innehåll, betalväggar eller komplexa single-page-applikationer bör ta hänsyn till detta när de utvärderar hur väl deras innehåll faktiskt renderas och indexeras.

Googles artikel understryker även vikten av serverprestanda i relation till crawlfrekvens. Om servern är långsam att leverera bytes backar crawlern automatiskt för att undvika överbelastning, vilket sänker crawlfrekvensen. Detta är ett ofta förbisett samband: det handlar inte enbart om att innehållet är tekniskt korrekt, utan om att det levereras tillräckligt snabbt för att Googles system ska kunna hämta det effektivt och regelbundet.

Vad du bör göra

  • Genomför en revision av sidans HTML-storlek med fokus på att identifiera sidor som riskerar att överskrida 2 MB, med särskild uppmärksamhet på sidor som innehåller inline base64-bilder, stora inbäddade skript eller omfattande navigationsstrukturer.
  • Flytta all tung CSS och allt JavaScript till externa filer så att det primära HTML-dokumentet hålls lean och att utrymmet används för innehåll och metadata som är kritiska för indexering.
  • Säkerställ att de viktigaste elementen i varje sida, som title-taggen, metataggar, kanoniska taggar och strukturerad data i schema.org-format, placeras så tidigt som möjligt i HTML-dokumentets källkod.
  • Övervaka serverloggar regelbundet för att detektera tecken på att crawlern backar på grund av långsamma svarstider, och åtgärda flaskhalsar i serverleverans för att upprätthålla en hög och stabil crawlfrekvens.
  • För webbplatser som använder JavaScript-ramverk och dynamiskt genererat innehåll bör man testa hur WRS tolkar sidorna via Googles URL-inspektionsverktyg och säkerställa att kritiskt innehåll är tillgängligt utan beroende av sessionsdata eller lokal lagring.
  • Lyssna på avsnitt 105 av Googles podcast Search Off the Record för ytterligare tekniska detaljer och diskussioner om crawlningsinfrastrukturen, eftersom Google-teamet delar insikter som inte alltid finns dokumenterade på annat håll.
Påverkan

Webbplatser med stora HTML-filer riskerar att kritiskt innehåll som strukturerad data, kanoniska taggar och metataggar placeras bortom 2 MB-gränsen och därmed aldrig indexeras av Google. En medveten hantering av sidstorlek och dokumentordning kan därför ha en direkt och mätbar effekt på synligheten i sökresultaten.

Officiell källa
Missa inga nyheter

Produktnyheter, algoritmuppdateringar och bästa praxis, direkt i din inkorg.

Tillbaka till bevakningen

Ligg steget före algoritmerna

Pulsar följer dina Google-placeringar, din synlighet i AI:er och dina sociala medier i en enda instrumentpanel. 14 dagars testperiod, utan kreditkort.

Starta en gratis testperiod