Wat is een robots.txt en wat zet je erin?
Een robots.txt is een tekstbestand in de hoofdmap van je website dat zoekmachines vertelt welke delen van je site ze wel en niet mogen crawlen. Het is een verzoek aan crawlers, geen beveiliging: gevoelige pagina’s bescherm je er niet mee.
Wat een robots.txt wel en niet doet
De robots.txt stuurt het crawlgedrag: je kunt er mappen of URL-patronen mee uitsluiten, zoals interne zoekresultaten of filterpagina’s. Wat veel mensen verwarren: een pagina blokkeren in robots.txt haalt hem niet uit Google. Sterker nog, als andere sites ernaar linken kan de URL alsnog in de zoekresultaten verschijnen, maar dan zonder beschrijving. Wil je een pagina echt uit de index houden, gebruik dan een noindex-instructie en laat de pagina juist wél crawlbaar.
Een veilige standaard voor WordPress
Deze regels laten alles toe, sluiten alleen de beheeromgeving uit en wijzen naar je sitemap.
Een veilig standaardvoorbeeld voor WordPress
Voor de meeste WordPress-sites volstaat een korte robots.txt: sta alles toe, blokkeer alleen /wp-admin/ (met een uitzondering voor admin-ajax.php) en verwijs naar je XML-sitemap. Blokkeer nooit je CSS- en JavaScript-bestanden: Google moet je pagina kunnen renderen zoals een bezoeker hem ziet, anders beoordeelt het een kale versie van je site.
De drie meestgemaakte fouten
Disallow: / laten staan
Na de lancering vergeten weg te halen, waardoor je hele site onzichtbaar wordt. Dit is de duurste regel uit de SEO-praktijk.
CSS en JavaScript blokkeren
Google moet je pagina kunnen renderen zoals een bezoeker hem ziet; anders beoordeelt het een kale versie.
Robots.txt gebruiken als noindex
Blokkeren haalt een pagina niet uit de index. Gebruik daarvoor een noindex-instructie en laat de pagina juist crawlbaar.
