AI-crawlers toelaten of blokkeren? GPTBot, OAI-SearchBot en co
Blokkeer AI-crawlers niet blind: elke bot heeft een ander doel. GPTBot verzamelt trainingsdata voor OpenAI-modellen, OAI-SearchBot indexeert voor ChatGPT Search, en Google-Extended stuurt alleen Gemini-training aan en raakt je zichtbaarheid in Google Search en AI Overviews niet. Wie zichtbaar wil zijn in AI-antwoorden laat zoekbots zoals OAI-SearchBot toe en beslist per trainingsbot apart. Blokkeren doe je per user-agent in robots.txt, nooit met een algemene disallow die ook Googlebot raakt.
- GPTBot verzamelt trainingsdata, terwijl OAI-SearchBot indexeert voor zichtbaarheid in ChatGPT Search.
- Google-Extended blokkeren raakt alleen Gemini en heeft geen invloed op Google Search of AI Overviews.
- Wie Bingbot blokkeert verdwijnt uit Bing en verliest tegelijk zichtbaarheid in Microsoft Copilot.
- Robots.txt is een verzoek, geen slot: hard blokkeren moet op serverniveau gebeuren.
Je robots.txt bepaalt tegenwoordig meer dan alleen je Google-zichtbaarheid: ook of je in ChatGPT-antwoorden opduikt. Eén verkeerde regel en je verdwijnt uit AI-zoekresultaten zonder dat je het merkt. Na dit artikel weet je per bot wat toelaten of blokkeren betekent en heb je een robots.txt die past bij jouw situatie.
Dit doen de belangrijkste AI-bots
De naam van de bot zegt weinig; het doel bepaalt je beslissing. Dit zijn de bots die je in de praktijk tegenkomt:
| Bot (user-agent) | Eigenaar | Doel | Gevolg van blokkeren |
|---|---|---|---|
| GPTBot | OpenAI | Trainingsdata voor AI-modellen | Je content wordt niet gebruikt voor toekomstige modeltraining |
| OAI-SearchBot | OpenAI | Indexering voor ChatGPT Search | Je site verschijnt niet meer in ChatGPT-zoekantwoorden |
| ChatGPT-User | OpenAI | Haalt pagina’s op als een gebruiker erom vraagt | Beperkt effect: dit verkeer start de gebruiker zelf en robots.txt-regels gelden hier niet altijd |
| ClaudeBot | Anthropic | Trainingsdata voor Claude-modellen | Geen gebruik voor training van nieuwe modellen |
| PerplexityBot | Perplexity | Indexering voor Perplexity-antwoorden | Minder tot geen vermeldingen in Perplexity |
| Google-Extended | Training en grounding van Gemini | Geen invloed op Google Search of AI Overviews |
Let op met Googlebot en Bingbot: dat zijn geen aparte AI-bots, maar hun crawls voeden wel AI-functies. AI Overviews draaien op de gewone Googlebot-crawl en Microsoft Copilot leunt op de Bing-index. Wie Bingbot blokkeert, verdwijnt dus uit Bing én verliest zichtbaarheid in Copilot.
Zo beslis je per bot: drie vragen
1. Is je content je product of je marketing?
Verdien je aan de content zelf, zoals uitgevers, opleiders en makers van betaalde kennis, dan is er veel voor te zeggen om trainingsbots te blokkeren: je geeft anders je product gratis weg. Is content vooral je marketingkanaal, wat voor de meeste mkb-bedrijven en webshops geldt, dan is een AI-antwoord dat jouw bedrijf noemt gratis zichtbaarheid.
2. Wil je gevonden worden in AI-zoekmachines?
Steeds meer mensen zoeken via ChatGPT, Perplexity en Copilot in plaats van via Google. Wil je daar vindbaar zijn, laat dan minimaal de zoekbots toe: OAI-SearchBot en PerplexityBot. Blokkeren betekent letterlijk niet meedoen in die antwoorden.
3. Heb je een principieel of juridisch standpunt over AI-training?
Wil je niet dat je teksten en foto’s modellen voeden, blokkeer dan de trainingsbots: GPTBot, ClaudeBot en Google-Extended. Leg die keuze ook vast richting klanten en bezoekers, want transparantie over AI-gebruik wordt steeds vaker verwacht. Hoe wij dat zelf aanpakken zie je in de juridische documenten van ViRank, waaronder de AI-transparantieverklaring.
Robots.txt: het codevoorbeeld
Dit voorbeeld laat AI-zoekbots toe en weert trainingsbots. Pas het aan naar jouw keuzes uit de vorige sectie:
# AI-zoekbots: toelaten voor zichtbaarheid in AI-antwoorden
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# AI-trainingsbots: blokkeren
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
Drie aandachtspunten:
- Robots.txt is een verzoek, geen slot. De grote partijen houden zich eraan, maar wie hard wil blokkeren moet dat op serverniveau doen.
- Een blokkade werkt niet met terugwerkende kracht: wat al in een trainingsset zit, haal je er niet mee uit.
- Je kunt ook per map blokkeren, dus Disallow: /kennisbank/ in plaats van de hele site.
Eén typfout in robots.txt kan ook gewone zoekmachines buitensluiten. Controleer na elke wijziging of je belangrijkste pagina’s crawlbaar blijven, of laat een technische SEO-scan dat doorlopend bewaken.
Wat blokkeren oplevert, en wat het kost
De afweging is uiteindelijk een ruil: data tegen zichtbaarheid. Wat je wint met blokkeren van trainingsbots is duidelijk en beperkt: je content voedt geen toekomstige modellen. OpenAI omschrijft het zelf zo: een disallow voor GPTBot geeft aan dat je content niet gebruikt hoort te worden voor het trainen van AI-basismodellen.
Wat het kost, hangt af van welke bot je raakt. Volgens de OpenAI-documentatie verdwijnen sites die OAI-SearchBot blokkeren uit de zoekantwoorden van ChatGPT; hooguit blijven ze zichtbaar als kale navigatielink. Voor een bedrijf dat klanten uit AI-antwoorden wil halen is dat een hoge prijs voor een principieel punt dat je ook met alleen een GPTBot-blokkade kunt maken.
Andersom geldt hetzelfde: wie in AI-antwoorden genoemd wil worden, moet crawlbaar zijn. Een AI-assistent kan geen bron citeren die hij nooit heeft mogen lezen.
Veelgemaakte fouten met AI-crawlers
- GPTBot blokkeren om uit ChatGPT te verdwijnen. GPTBot gaat over training; zichtbaarheid in ChatGPT Search loopt via OAI-SearchBot. Bepaal eerst welk doel je hebt en blokkeer dan de juiste bot.
- Google-Extended blokkeren en verwachten dat je uit AI Overviews verdwijnt. Google-Extended stuurt alleen Gemini-training en grounding aan. AI Overviews volgen de normale Search-regels via Googlebot.
- Een algemene User-agent: * met Disallow: / instellen. Daarmee blokkeer je ook Googlebot en Bingbot en verdwijn je uit de gewone zoekresultaten. Werk altijd per user-agent.
- Vergeten dat Bingbot ook Copilot voedt. Wie Bingbot weert om AI-redenen, offert ook zijn Bing-posities op. Die koppeling kun je niet los van elkaar instellen.
- Eén keer instellen en nooit meer kijken. Er komen regelmatig nieuwe bots bij. Loop je robots.txt elk kwartaal na tegen de actuele botoverzichten van OpenAI en Google.
- Blokkeren op serverniveau zonder verificatie. Scrapers doen zich regelmatig voor als GPTBot. Controleer verdacht verkeer tegen de officiële IP-reeksen voordat je op IP blokkeert.
Of je keuzes uitpakken zoals bedoeld, zie je pas als je meet waar je merk in AI-antwoorden opduikt. De AI-vindbaarheidsmeting van ViRank volgt hoe vaak ChatGPT, Gemini, Perplexity en Copilot jouw site noemen bij vragen uit jouw markt. Daalt dat na een robots.txt-wijziging, dan weet je binnen weken dat je moet bijsturen, in plaats van er maanden later achter te komen. ViRank draait op je WordPress-site, zet verbeteringen op volgorde van omzetkans en raakt niets aan zonder jouw akkoord. De eerste 14 dagen zijn gratis, zonder creditcard.
