Robots.txt is een klein tekstbestand op je website dat zoekmachines vertelt welke delen ze mogen doorzoeken en welke niet. Het staat los van hoe hoog je in Google komt, maar regelt wel welke crawlers toegang krijgen tot welke paginas. De meeste kleine bedrijfssites hebben er weinig aan te sturen, maar een verkeerd ingesteld bestand kan wel per ongeluk je hele site voor Google afsluiten.
Wat robots.txt precies doet
Elke website kan een bestand hebben op het adres jouwsite.nl/robots.txt. Daarin staan simpele regels die crawlers, de programmas die zoekmachines gebruiken om websites te doorzoeken, vertellen welke mappen of paginas ze wel of niet mogen bezoeken. Denk aan een intern zoekresultaat, een testomgeving of een winkelmandje dat niets toevoegt als losse pagina in Google.
Een voorbeeld
Een regel als "Disallow: /winkelwagen/" zegt tegen crawlers dat ze die map mogen overslaan. De meeste websitebouwers, waaronder joepa, zetten een werkend robots.txt-bestand vanzelf klaar zodra je site live gaat. Je hoeft er als ondernemer normaal gesproken niets aan te veranderen.
Wat robots.txt niet kan
Het grootste misverstand: robots.txt verbergt geen paginas uit de zoekresultaten. Het is een verzoek, geen slot. Een pagina die je blokkeert met robots.txt kan alsnog in Google verschijnen, bijvoorbeeld als andere sites ernaar linken. Wil je een pagina echt onvindbaar houden, dan gebruik je een noindex-instructie op de pagina zelf of zet je hem achter een wachtwoord.
Robots.txt regelt wie mag meekijken, niet wat er te zien is als iemand toch binnenkomt.
Veelgemaakte fouten
De meeste schade aan vindbaarheid door robots.txt komt niet doordat het ontbreekt, maar doordat het verkeerd staat ingesteld. Een regel als "Disallow: /" blokkeert per ongeluk de hele website voor Google, iets dat vaker gebeurt dan je zou denken, bijvoorbeeld als een testversie van een site die instelling meeneemt naar productie.
Blokkeer geen stijl- en scriptbestanden
Sommige oudere sites sluiten ook mappen met opmaak- en scriptbestanden af. Daardoor kan Google je pagina niet meer goed weergeven en beoordeelt de zoekmachine hem slechter. Laat die bestanden dus altijd toegankelijk.
Robots.txt en AI-crawlers
Naast de bekende zoekmachines lezen ook crawlers van AI-diensten zoals ChatGPT en Perplexity soms robots.txt om te bepalen of ze een site mogen bezoeken. Je kunt daar specifieke regels voor opnemen, los van wat je voor Google instelt. Dat is een ander bestand en een ander doel dan llms.txt, dat AI juist helpt om je content te begrijpen zodra hij wel is opgehaald.
Samengevat
- Robots.txt bepaalt welke delen van je site crawlers mogen bezoeken
- Het verbergt paginas niet uit Google, dat regel je met noindex
- Blokkeer nooit je hele site of je opmaak- en scriptbestanden per ongeluk
- Sommige AI-crawlers lezen hetzelfde bestand voor toegang
- Voor de meeste mkb-sites staat het goed als de website goed is opgezet