Ga naar inhoud
    Kennisbank · SEO & GEO · 6 min lezen

    Waar halen ChatGPT, Gemini en Perplexity hun antwoorden vandaan?

    Door Bouke Majoor · Bijgewerkt op

    Bekijk de GEO-aanpak

    Een AI-assistent haalt zijn antwoord uit twee bronnen: wat het model tijdens de training heeft gelezen, en wat het op het moment van de vraag op het web opzoekt. Voor dat zoeken gebruikt elke assistent een eigen zoekindex en een eigen crawler. Gemini leunt op Google, Copilot op Bing, en ChatGPT, Perplexity en Claude sturen hun eigen crawlers langs je site.

    Dat verklaart waarom dezelfde vraag per assistent een ander antwoord geeft. Het betekent ook dat je per assistent kunt nagaan of hij je site mag en kan lezen. Hieronder staat welke crawler bij welke assistent hoort en welke vier controles ik zelf als eerste doe.

    In het kort

    • Wat in het model zit, ligt vast tot de volgende versie. Wat het opzoekt, kan morgen anders zijn.
    • ChatGPT zoekt met OAI-SearchBot, Perplexity met PerplexityBot en Claude met Claude-SearchBot.
    • Gemini gebruikt de index van Google, Copilot die van Bing.
    • Je kunt training weigeren en toch in zoekantwoorden blijven staan: daar zijn aparte crawlers voor.
    • De crawlers van de assistenten lezen de HTML van de server. Tekst die pas na JavaScript verschijnt, missen ze doorgaans.

    Uit de training of van het web

    Een taalmodel wordt getraind op een grote hoeveelheid tekst tot een bepaalde datum. Wat het daarvan onthoudt, zit in het model en verandert niet tot er een nieuwe versie komt. Staat je bedrijf daar verkeerd in, met een oude naam of een dienst die je niet meer levert, dan krijg je dat niet met één aanpassing recht.

    Bij veel vragen zoekt de assistent daarnaast live op het web, vooral als het om bedrijven, prijzen of actuele zaken gaat. Dat herken je aan de bronnen onder het antwoord. Op dat deel heb je wel invloed: een aangepaste pagina kan in een volgend antwoord al gebruikt worden, zodra de zoekindex erachter hem opnieuw heeft opgehaald.

    Welke assistent gebruikt welke bron?

    De namen in de derde kolom zijn de namen waarmee een crawler zich bij je server meldt. Je komt ze tegen in je serverlogs en je gebruikt ze in robots.txt.

    AssistentZoekt viaCrawler voor zoekenCrawler voor training
    ChatGPTEigen zoekfunctie en zoekpartnersOAI-SearchBotGPTBot
    GeminiDe index van GoogleGooglebotGoogle-Extended, een naam in robots.txt en geen eigen crawler
    AI-overzichten en AI-modusDe index van GoogleGooglebotGeen aparte crawler
    CopilotDe index van BingBingbotGeen aparte crawler
    PerplexityEigen indexPerplexityBotGeen aparte crawler
    ClaudeZoekfunctie met eigen crawlerClaude-SearchBotClaudeBot

    Daarnaast hebben ChatGPT, Perplexity en Claude een derde bezoeker: ChatGPT-User, Perplexity-User en Claude-User. Die komt langs als een gebruiker de assistent vraagt een bepaalde pagina te openen. De documentatie staat bij OpenAI, Perplexity en Anthropic.

    Vier controles die je zelf doet

    1. Robots.txt. Open jouwdomein.nl/robots.txt en zoek op de namen uit de tabel. Staat er bij OAI-SearchBot, PerplexityBot of Claude-SearchBot een regel met Disallow: /, dan komt je site in de zoekantwoorden van die assistent niet voor. OpenAI schrijft dat een wijziging in robots.txt ongeveer een dag nodig heeft om door te werken.
    2. Je hostingpartij of beveiligingsdienst. Een crawler kan ook worden tegengehouden voordat hij je robots.txt leest. Cloudflare kondigde in juli 2025 aan AI-crawlers standaard te blokkeren. Zit je site achter zo'n dienst, vraag dan na wat er voor AI-crawlers is ingesteld.
    3. De ruwe HTML. Open je belangrijkste pagina, kies Paginabron weergeven en zoek op een zin uit het midden van je tekst. Vind je hem niet, dan wordt de tekst pas door JavaScript geplaatst en zien de meeste AI-crawlers die tekst niet.
    4. Bing. Typ in Bing site:jouwdomein.nl. Ontbreken je dienstpagina's, meld je site dan aan bij Bing Webmaster Tools en dien je sitemap in. Copilot gebruikt die index.

    Op mijn eigen site staat robots.txt open voor elke crawler, op het beheerdeel na. Aangepaste pagina's meld ik na elke wijziging automatisch bij Bing via IndexNow, zodat ik niet hoef te wachten tot Bing zelf langskomt.

    Training weigeren en toch gevonden worden

    Dat kan, omdat training en zoeken aparte crawlers hebben. Zet je GPTBot en ClaudeBot op Disallow en laat je OAI-SearchBot en Claude-SearchBot toe, dan gebruiken OpenAI en Anthropic je tekst niet voor training, terwijl je pagina's wel in zoekantwoorden kunnen staan.

    Bij Google werkt het met Google-Extended. Blokkeer je die naam, dan mag Gemini je inhoud niet gebruiken voor training en ook niet om antwoorden in de Gemini-app te onderbouwen. Op Google Zoeken, de AI-overzichten en de AI-modus heeft het volgens Google geen invloed.

    Voor een bedrijf dat klanten zoekt, zou ik niets blokkeren. Een uitgever die van zijn artikelen leeft, maakt een andere afweging. Kies wel bewust. Een regel die ooit door een webbouwer is toegevoegd en waar niemand meer van weet, is geen keuze.

    Waarom dezelfde vraag per assistent een ander antwoord geeft

    Omdat elke assistent in een andere index zoekt, andere pagina's ophaalt en een ander model heeft dat de keuze maakt. Een bedrijf dat goed in Google staat en nooit bij Bing is aangemeld, kan in Gemini genoemd worden en in Copilot ontbreken.

    Meet daarom per assistent, met dezelfde vragen. Hoe je die meting opzet, staat in ChatGPT SEO: zichtbaar worden in ChatGPT. Zie je grote verschillen, begin dan bij de assistent waar je ontbreekt en loop de vier controles hierboven voor die assistent na.

    Kunnen de assistenten jouw site lezen?

    Ik loop de crawlers, je robots.txt en de HTML van je belangrijkste pagina's na, en meet in welke assistenten je genoemd wordt.

    Bekijk de GEO-aanpak

    Veelgestelde vragen

    Moet ik GPTBot toelaten in robots.txt?

    Dat hoeft niet om in ChatGPT gevonden te worden. GPTBot haalt tekst op voor de training van modellen. Voor de zoekantwoorden van ChatGPT gebruikt OpenAI een andere crawler, OAI-SearchBot. Die moet je wel toelaten als je in die antwoorden wilt voorkomen.

    Lezen AI-crawlers JavaScript?

    De crawlers van OpenAI, Anthropic en Perplexity lezen de HTML zoals de server die stuurt en voeren doorgaans geen JavaScript uit. Googlebot doet dat wel. Staat je tekst alleen na JavaScript op de pagina, dan kan Gemini hem kennen terwijl ChatGPT hem mist.

    Hoe zie ik of een AI-crawler op mijn site is geweest?

    In je serverlogs, aan de naam van de crawler. Je hostingpartij kan die logs leveren. In GA4 zie je crawlers niet, want die voeren het meetscript niet uit.

    Gebruikt Gemini dezelfde bronnen als Google Zoeken?

    Voor het opzoeken van actuele informatie gebruikt Gemini de index van Google. Sta je daar niet in, dan kan Gemini je pagina niet als bron gebruiken. Wat het model daarnaast uit zijn training weet, staat daar los van.

    Helpt een sitemap voor AI-assistenten?

    Indirect. Een sitemap helpt Google en Bing om je pagina's te vinden, en twee van de assistenten zoeken in die indexen. Hoe de eigen crawlers van ChatGPT, Perplexity en Claude nieuwe pagina's vinden, is minder duidelijk. Interne links blijven de zekerste weg.

    Maandelijks deel ik wat werkt

    Als het echt interessant is, deel ik wat werkt: strategieën, tools en lessen uit de praktijk. Compact en direct toepasbaar.

    Afmelden kan altijd. Ik ga zorgvuldig om met je gegevens. Lees eerst wat er in de nieuwsbrief staat.