Vindbaarheid9 sep 2026·7 min lezen

AI-crawlers toelaten of blokkeren: GPTBot, ClaudeBot, PerplexityBot en de rest

App me je situatie, dan zeg ik waar ik zou beginnen.Stuur een appje

Wil je genoemd worden in AI-antwoorden, dan moet je de crawlers van die systemen toelaten in je robots.txt. Blokkeer je GPTBot, PerplexityBot of OAI-SearchBot, dan kunnen ze je pagina's niet lezen en kun je dus niet in hun antwoorden staan. Het belangrijkste onderscheid dat bijna iedereen mist: sommige crawlers verzamelen trainingsmateriaal, andere bouwen een zoekindex. Je kunt die twee apart regelen, en dat is meestal precies wat je wilt.

Ik loop dit bij elke site die ik oplever na, en ik kom het bij overnames van andere bureaus regelmatig fout tegen. Meestal omdat er ooit een plugin is geïnstalleerd die alle AI-bots op slot zette, met de beste bedoelingen. Het gevolg is dat zo'n bedrijf structureel buiten AI-antwoorden valt zonder dat iemand het doorheeft, want je krijgt er geen melding van.

De drie soorten AI-crawlers, en waarom dat onderscheid alles bepaalt

Een trainingscrawler haalt tekst op om er een model mee te trainen. Wat hij meeneemt, verdwijnt in het geheugen van dat model en komt daar mogelijk jaren later nog uit, zonder bronvermelding en zonder link naar jou. Daar krijg je niets voor terug.

Een zoekcrawler bouwt een index waaruit het systeem live put wanneer iemand een vraag stelt. Word je daaruit geciteerd, dan staat je naam in het antwoord en meestal ook een link. Dit is de crawler waar je bij wilt zitten.

En dan is er de ophaler die pas langskomt op het moment dat een gebruiker iets vraagt waarvoor jouw pagina relevant lijkt. Die leest één pagina, gebruikt hem voor dat ene antwoord en gaat weer weg. Ook die wil je toelaten, want anders krijgt de gebruiker een antwoord waarin jij ontbreekt terwijl je pagina de vraag perfect had beantwoord.

Alle AI-crawlers op een rij: wie stuurt ze en wat doen ze

User-agentVan wieTypeToelaten?
GPTBotOpenAITrainingAlleen als je geen bezwaar hebt tegen trainingsgebruik
OAI-SearchBotOpenAIZoekindex ChatGPTJa, dit is je route naar ChatGPT
ChatGPT-UserOpenAIOphaler bij een vraagJa
ClaudeBotAnthropicTraining en indexJa
Claude-UserAnthropicOphaler bij een vraagJa
Claude-SearchBotAnthropicZoekindexJa
PerplexityBotPerplexityZoekindexJa
Perplexity-UserPerplexityOphaler bij een vraagJa
GooglebotGoogleZoekindex, voedt AI OverviewsJa, altijd
Google-ExtendedGoogleTraining GeminiJa, tenzij je bezwaar hebt
BingbotMicrosoftZoekindex, voedt CopilotJa
ApplebotAppleSiri en SpotlightJa
Applebot-ExtendedAppleTrainingJa, tenzij je bezwaar hebt
CCBotCommon CrawlOpenbaar archief, voedt veel modellenJa
AmazonbotAmazonAlexa en zoekfunctiesJa
meta-externalagentMetaTraining Meta AIJa, tenzij je bezwaar hebt
Meta-ExternalFetcherMetaOphaler bij een vraagJa
DuckAssistBotDuckDuckGoAI-antwoordenJa
MistralAI-UserMistralOphaler bij een vraagJa
cohere-aiCohereTrainingJa, tenzij je bezwaar hebt
YouBotYou.comZoekindexJa
BytespiderByteDanceTrainingNaar eigen inzicht
AI2BotAllen InstituteOnderzoekJa
DiffbotDiffbotDatavergaringNaar eigen inzicht
Deze lijst verandert. Nieuwe crawlers komen erbij en namen wijzigen. Controleer je serverlogboek af en toe op user-agents die je niet herkent.

Google-Extended blokkeren haalt je niet uit AI Overviews

Dit is het hardnekkigste misverstand dat ik tegenkom, en het kost bedrijven zichtbaarheid. Google-Extended regelt of je content gebruikt mag worden om Gemini te trainen en te voeden. Het regelt niet of je in AI Overviews verschijnt. Die worden gebouwd op de gewone Google-index, en die wordt gevuld door Googlebot.

Praktisch betekent dat: wil je uit AI Overviews blijven, dan moet je uit Google Zoeken blijven. Dat wil vrijwel niemand. En omgekeerd: heb je Google-Extended geblokkeerd omdat je dacht daarmee uit AI-antwoorden te blijven, dan heb je alleen jezelf uit Gemini gehaald terwijl je nog gewoon in AI Overviews staat. Google zelf documenteert dit onderscheid in de uitleg over crawlers en gebruikersagenten.

Voor de meeste vakbedrijven is dat prima nieuws. Je wilt in AI Overviews staan, want dat is inmiddels bij veel zoekopdrachten het eerste wat iemand ziet. Hoe je die positie opbouwt, hangt samen met je gewone vindbaarheid, en daarover schreef ik hoe lokale ranking echt werkt.

Een robots.txt die AI-crawlers netjes toelaat

Voor negen van de tien bedrijven is dit het juiste bestand. Alles toe, behalve pagina's die niet in zoekresultaten thuishoren, zoals advertentielandingspagina's en bedanktpagina's.

Basisversie: alles toelaten

User-agent: * op de eerste regel met Allow: / eronder dekt élke crawler die zich aan de regels houdt, ook alle AI-crawlers. Losse blokken per bot zijn dan strikt genomen overbodig. Ze hebben één praktisch nut: ze maken expliciet zichtbaar dat de keuze bewust is genomen, zodat de volgende die je bestand opent niet gaat lopen sleutelen.

Vergeet de regel met je sitemap niet. Die staat los van de user-agent-blokken en wijst elke crawler naar de volledige lijst met pagina's. Zonder die verwijzing moet een crawler je site zelf uitpluizen via links, en dat gaat trager en onvollediger.

Wel in AI-antwoorden, niet in trainingsdata

Dit is de middenweg waar veel ondernemers naar zoeken zodra ze het onderscheid doorhebben. Je wilt genoemd worden wanneer iemand een vraag stelt, maar je wilt niet dat je jarenlange vakkennis gratis in een model verdwijnt. Dat kan, want de crawlers zijn gescheiden.

DoelBlokkerenToelaten
Maximale zichtbaarheidNietsAlles
Wel zichtbaar, niet in trainingsdataGPTBot, Google-Extended, Applebot-Extended, CCBot, meta-externalagent, cohere-aiOAI-SearchBot, ChatGPT-User, PerplexityBot, Perplexity-User, Claude-User, Googlebot, Bingbot
Volledig buiten AI blijvenAlle bovenstaande, plus accepteren dat je uit Google Zoeken moetNiets zinvols

Mijn eerlijke advies aan vrijwel elk vakbedrijf: kies de eerste rij. De angst dat een model met jouw kennis aan de haal gaat is begrijpelijk, maar de kans dat een klant jou vindt weegt zwaarder dan de kans dat een concurrent via een model jouw werkwijze afkijkt. Je verkoopt uitvoering, niet informatie. Bij een uitgever of een opleider ligt die afweging anders.

Weet je niet zeker wat er in jouw robots.txt staat?

Ik kijk er kosteloos even naar en zeg je of je jezelf onbedoeld buitensluit. Meestal is het binnen een minuut duidelijk.

Vraag je project aan App me

Robots.txt is een verzoek, geen slot

Dit moet erbij, anders wek ik een verkeerde indruk. Robots.txt is een afspraak. Een crawler die zich eraan houdt leest je regels en gehoorzaamt. Een crawler die dat niet doet, negeert het bestand en haalt je pagina's gewoon op. Er is geen technische afdwinging.

Wil je iets echt dichtzetten, dan moet dat op serverniveau: verzoeken van bepaalde user-agents weigeren, of een firewallregel. Dat is werk voor je hostingpartij en het heeft nadelen, want je kunt legitieme bezoekers per ongeluk buitensluiten. Voor de meeste bedrijven is dat overdreven.

Wat wel nuttig is: af en toe je serverlogboek doorkijken op user-agents die je niet kent. Zie je een onbekende bot die honderden pagina's per uur ophaalt en je server belast, dan is dat een reden om in te grijpen. Zie je alleen de bekende namen uit de tabel hierboven, dan gaat het goed.

Hoe je controleert of je robots.txt klopt

  1. 1Typ je domein in met /robots.txt erachter en kijk wat er staat. Krijg je een 404, dan is er geen bestand en is standaard alles toegestaan. Dat is niet fout, maar wel onhandig, want dan mist ook je sitemapverwijzing.
  2. 2Zoek naar het woord Disallow met een enkele schuine streep erachter. Staat dat er onder User-agent: *, dan is je hele site geblokkeerd. Dat gebeurt vaker dan je denkt na een verhuizing van een testomgeving.
  3. 3Controleer of er blokken staan voor de crawlers uit de tabel hierboven met een Disallow. Dat is meestal een plugin die het ooit heeft toegevoegd.
  4. 4Kijk of je sitemapregel erin staat en of die URL werkt.
  5. 5Gebruik de robots.txt-tester in Google Search Console om te zien hoe Google je bestand leest.

Kom je erachter dat er iets geblokkeerd stond, verwacht dan geen resultaat van de ene op de andere dag. Een crawler moet opnieuw langskomen en je pagina's alsnog ophalen. Reken op enkele weken voordat je het effect terugziet. Dat geldt trouwens ook voor gewone indexering, en daarover schreef ik hoe lang het duurt voordat een nieuwe site in Google staat.

Staat alles goed en word je nog steeds niet genoemd, dan ligt het niet aan je robots.txt maar aan je inhoud of aan je aanwezigheid buiten je eigen domein. Dat is een ander gesprek, en dat voer ik in waarom ChatGPT je concurrent noemt en jou niet.

Veelgestelde vragen

Moet ik GPTBot toelaten of blokkeren?

GPTBot verzamelt trainingsmateriaal voor OpenAI. Blokkeer je hem, dan blijf je gewoon zichtbaar in ChatGPT-antwoorden, want daar zorgen OAI-SearchBot en ChatGPT-User voor. Wil je maximale zichtbaarheid en heb je geen bezwaar tegen trainingsgebruik, laat hem dan toe. Wil je alleen zichtbaar zijn zonder trainingsmateriaal te leveren, blokkeer dan GPTBot en laat de andere twee open.

Haalt het blokkeren van Google-Extended mij uit AI Overviews?

Nee. Google-Extended regelt alleen of je content gebruikt mag worden voor Gemini. AI Overviews worden gebouwd op de gewone Google-index, die door Googlebot wordt gevuld. Wil je uit AI Overviews blijven, dan moet je uit Google Zoeken blijven, en dat wil vrijwel niemand.

Wat is het verschil tussen PerplexityBot en Perplexity-User?

PerplexityBot bouwt de zoekindex van Perplexity en komt uit zichzelf langs. Perplexity-User haalt een specifieke pagina op omdat een gebruiker op dat moment een vraag stelt waarvoor die pagina relevant lijkt. Blokkeer je de tweede, dan kan je pagina niet gebruikt worden in een antwoord, ook al sta je wel in de index.

Kan ik in AI-antwoorden staan zonder dat mijn teksten trainingsmateriaal worden?

Ja, want de crawlers zijn gescheiden. Blokkeer de trainingscrawlers (GPTBot, Google-Extended, Applebot-Extended, CCBot, meta-externalagent) en laat de zoek- en ophaalcrawlers open (OAI-SearchBot, ChatGPT-User, PerplexityBot, Perplexity-User, Claude-User, Googlebot, Bingbot).

Werkt robots.txt echt om crawlers tegen te houden?

Alleen bij crawlers die zich aan de afspraak houden, en dat zijn er gelukkig veel. Robots.txt is een verzoek, geen technisch slot. Wil je iets echt dichtzetten, dan moet dat op serverniveau via een firewallregel of het weigeren van bepaalde user-agents. Voor de meeste bedrijven is dat overdreven.

Ik heb geen robots.txt. Is dat erg?

Niet direct, want zonder bestand is standaard alles toegestaan en kunnen alle crawlers bij je pagina's. Wel mis je de verwijzing naar je sitemap, waardoor crawlers je site zelf moeten uitpluizen via links. Dat gaat trager en onvollediger. Een minimaal bestand met alleen die sitemapregel is al winst.

Hoeveel losse blokken heb ik nodig in mijn robots.txt?

Strikt genomen geen enkele. Een regel met een sterretje als user-agent en toestemming eronder dekt elke crawler die zich aan de regels houdt, inclusief alle AI-crawlers. Losse blokken per bot hebben één nut: ze maken zichtbaar dat de keuze bewust is genomen, zodat niemand later gaat sleutelen.

Hoe lang duurt het voordat een aanpassing in robots.txt effect heeft?

Reken op enkele weken. Een crawler moet opnieuw langskomen, je gewijzigde bestand lezen en daarna alsnog je pagina's ophalen. Bij Google kun je dat versnellen door je sitemap opnieuw in te dienen in Search Console, maar bij AI-crawlers is er geen knop om op te drukken.

Moet ik Bytespider blokkeren?

Dat is een eigen afweging. Bytespider is de crawler van ByteDance, het bedrijf achter TikTok, en verzamelt trainingsmateriaal. Er zijn meldingen dat hij zich niet altijd netjes aan robots.txt houdt en veel serverbelasting geeft. Merk je dat in je logboek, blokkeer hem dan op serverniveau in plaats van alleen in robots.txt.

Lees ook

Bespreek je project

Vertel me kort waar je mee bezig bent, dan maak ik je een vrijblijvend aanbod op maat.