Crawlbudget optimaliseren: voor wie het echt speelt
Voor de meeste websites hoeft het niet. Google geeft zelf aan dat crawlbudget pas een rol speelt op sites met ruwweg een miljoen unieke pagina's, of op sites met tienduizenden pagina's die dagelijks veranderen. Een gemiddelde WordPress-site met een paar honderd URL's wordt gewoon volledig gecrawld. De uitzondering in het mkb: webshops met facetnavigatie, die ongemerkt tienduizenden filter-URL's genereren. Daar loont opschonen wel, want Google crawlt dan rommel terwijl nieuwe producten wachten.
- Crawlbudget speelt volgens Google pas vanaf ongeveer een miljoen pagina's of dagelijks wijzigende tienduizenden.
- Webshops met facetnavigatie genereren ongemerkt tienduizenden filter-URL's die het budget opslokken.
- Robots.txt is de enige maatregel die crawls echt voorkomt; een canonical bespaart geen crawls.
- Veel pagina's in "Gedetecteerd, momenteel niet geïndexeerd" is het duidelijkste crawlbudgetsignaal.
Crawlbudget is een van de meest overschatte onderwerpen in technische SEO: bijna iedereen hoort erover, bijna niemand heeft er last van. Na dit artikel kun je zelf vaststellen of het probleem op jouw site speelt, en weet je welke stappen verschil maken als dat zo is. Dat scheelt tijd die je beter in content of snelheid kunt steken.
Wat Google zelf over crawlbudget zegt
Crawlbudget is de combinatie van twee factoren: hoeveel verzoeken je server aankan zonder te vertragen (crawlcapaciteit) en hoe graag Google je pagina’s wil ophalen (crawlvraag). Google is in de eigen documentatie opvallend direct over wie zich hiermee bezig moet houden: sites met ongeveer een miljoen unieke pagina’s waarvan de inhoud regelmatig verandert, en middelgrote sites vanaf zo’n tienduizend pagina’s met content die dagelijks wijzigt. Google noemt daarnaast sites waarvan een groot deel van de URL’s in Search Console als “Gedetecteerd, momenteel niet geïndexeerd” staat.
Valt jouw site buiten die drie groepen, dan crawlt Google simpelweg alles wat je publiceert. Wordt een nieuwe pagina niet geïndexeerd, dan is dat vrijwel nooit een crawlbudgetprobleem, maar een kwaliteits- of linkprobleem. Die eerlijkheid vooraf voorkomt dat je weken optimaliseert aan iets dat niets oplevert.
Zo stel je in vijf minuten vast of het speelt
Je hebt geen logfile-analyse nodig voor een eerste diagnose. Drie checks in Google Search Console volstaan:
- Indexering, Pagina’s: vergelijk het totaal aantal bekende URL’s met het werkelijke aantal pagina’s en producten op je site. Kent Google een veelvoud van wat je echt hebt, dan genereert je site ergens overbodige URL’s.
- Instellingen, Crawlstatistieken: bekijk welke URL’s Google de afgelopen negentig dagen daadwerkelijk opvroeg. Zie je vooral verzoeken naar URL’s met parameters zoals ?orderby= of ?filter=, dan gaat het budget op aan varianten in plaats van aan echte pagina’s.
- De categorie “Gedetecteerd, momenteel niet geïndexeerd”: staan hier structureel veel belangrijke pagina’s in, dan weet Google dat ze bestaan maar komt hij er niet aan toe. Dat is het duidelijkste crawlbudgetsignaal dat er is.
Wil je dit niet handmatig uitzoeken, dan haalt een gratis website-analyse dezelfde signalen boven water, inclusief de URL-patronen die het budget opslokken.
Waarom webshops met facetnavigatie de uitzondering zijn
Een gewone bedrijfssite met tachtig pagina’s haalt de drempels van Google nooit. Een webshop met facetnavigatie kan dat wel, ook met een bescheiden assortiment. Elke filtercombinatie krijgt namelijk een eigen URL: merk, kleur, maat, prijsklasse, sortering en paginering vermenigvuldigen zich met elkaar. Een shop met tweehonderd producten in tien categorieën heeft maar zo’n tweehonderdtien echte pagina’s, maar de filtercombinaties lopen al snel in de tienduizenden URL’s.
Googlebot volgt de links naar al die varianten en behandelt elke URL als een aparte pagina. Tel daar interne zoekresultaten, sessieparameters en kalenderarchieven bij op, en het budget dat naar nieuwe producten en gewijzigde prijzen zou moeten gaan, verdwijnt in eindeloze filterpagina’s. Het gevolg merk je pas laat: prijswijzigingen die dagen oud zijn in de zoekresultaten, en nieuwe producten die traag of niet geïndexeerd raken.
Opschonen in de juiste volgorde
Speelt het probleem echt op jouw site, werk dan van grof naar fijn:
- Blokkeer waardeloze parameter-URL’s in robots.txt. Dit is de enige maatregel die crawls daadwerkelijk voorkomt. Gebruik hem alleen voor URL’s die nooit indexwaarde hebben, zoals sorteringen en interne zoekresultaten:
Let op: robots.txt stopt het crawlen, niet het indexeren. Een geblokkeerde URL kan zonder content in de index blijven staan als er links naartoe wijzen.User-agent: * Disallow: /*?orderby= Disallow: /*?*filter_ Disallow: /zoekresultaten/ - Beperk interne links naar filtervarianten. Wat niet gelinkt wordt, wordt zelden gecrawld. Zorg dat filters die geen zoekvraag bedienen niet als gewone links in de HTML staan.
- Zet canonicals op filtervarianten die je wel toegankelijk laat. Dat lost duplicatie in de index op, maar bespaart geen crawls: Google moet de pagina ophalen om de canonical te kunnen lezen. Zie het als opruimen, niet als besparen.
- Houd je sitemap schoon en actueel. Alleen indexeerbare URL’s die een 200 teruggeven, met een kloppende lastmod-datum. Hoe zo’n XML-sitemap precies werkt en hoe je hem aanmeldt, staat in de kennisbank.
- Geef verwijderde producten een 410 en ruim redirectketens op. Elke tussenstap in een keten kost een extra verzoek.
- Verlaag je serverresponstijd. Google verhoogt de crawlcapaciteit vanzelf als je site snel en foutloos antwoordt.
Veelgemaakte fouten bij crawlbudget
- Robots.txt combineren met noindex op dezelfde URL’s. Google kan de noindex-tag nooit lezen op een pagina die hij niet mag ophalen. Kies per URL-groep één instrument: blokkeren of de-indexeren.
- Alles op noindex zetten om budget te sparen. Een noindex-pagina moet juist gecrawld worden om de tag te zien, dus je bespaart er op korte termijn niets mee. Voor echte rommel is robots.txt het juiste middel.
- Crawl-delay instellen in robots.txt. Googlebot negeert die regel volledig. Wil je het crawltempo beïnvloeden, verbeter dan je serverresponstijd.
- Een kleine site wekenlang optimaliseren. Met tachtig pagina’s is crawlbudget nooit je bottleneck. Steek die tijd in content, interne links en snelheid.
- Een sitemap vol redirects en 404’s laten staan. Dat verspilt verzoeken en verlaagt het vertrouwen van Google in je sitemap als geheel. Genereer hem automatisch en alleen met werkende URL’s.
- Filter-URL’s blokkeren die wel zoekvraag hebben. Een pagina als “rode herenschoenen maat 43” kan een waardevolle landingspagina zijn. Controleer eerst het zoekvolume voordat je een heel parameterpatroon dichtzet.
Handmatig crawlstatistieken en URL-patronen doorspitten is precies het soort werk dat software beter volhoudt dan een mens. De Technische SEO-module van ViRank speurt doorlopend naar parameter-explosies, redirectketens, kapotte sitemaps en geblokkeerde pagina’s, en sorteert de gevonden problemen op verwachte omzetimpact. Oplossingen zet je vervolgens live op je WordPress-site zodra jij akkoord geeft, en elke wijziging kun je met één klik terugdraaien. Benieuwd of Google op jouw site rommel crawlt? Start met de gratis SEO-check van ViRank en zie binnen een paar minuten waar je staat. Daarna kun je 14 dagen alles proberen zonder creditcard.
