Over TextWardenBot
TextWardenBot is de crawler achter Taalwacht. Hij leest openbare pagina's, zodat de mensen die die sites beheren spel-, grammatica- en stijlfouten in hun eigen teksten kunnen vinden. Deze pagina legt precies uit wat hij doet en hoe je hem voorgoed wegstuurt.
Hoe je hem herkent
Elk verzoek bevat deze User-Agent-header en komt van onze eigen servers. De link erin verwijst naar deze pagina.
User-Agent: TextWardenBot/0.1 (+https://textwarden.com/bot)
De User-Agent noemt op al onze domeinen textwarden.com: dat is letterlijk de tekst die onze servers versturen.
Wat hij doet
- Leest eerst robots.txt en daarna de sitemap. Is er geen bruikbare sitemap, dan volgt hij de links vanaf de homepage.
- Haalt de HTML van een pagina op en haalt daar de tekst uit die een bezoeker ziet. Afbeeldingen, scripts en stijlen negeert hij.
- Laadt een pagina alleen in een headless browser als de tekst pas na JavaScript verschijnt, zodat ook een site die volledig op JavaScript draait leesbaar is.
- Controleert die tekst op spelling, grammatica en stijl, en meldt de fouten aan degene die ons vroeg die site te bewaken.
- Leest een pagina later opnieuw om te zien wat er veranderd is, met conditionele verzoeken, zodat een ongewijzigde pagina je vrijwel niets kost.
Wat hij niet doet
- Hij verstuurt geen formulieren, logt niet in, klikt niet op knoppen en voert niets uit op je site. Hij leest alleen.
- Hij verzamelt geen persoonsgegevens, e-mailadressen of prijzen, en verkoopt niets door van wat hij leest.
- Hij gebruikt je content niet om AI-modellen te trainen.
- Hij publiceert je pagina's niet opnieuw. De gevonden tekst is alleen zichtbaar voor het account dat die site bewaakt.
Hoe hij zich gedraagt
- Hij respecteert de Disallow-regels in robots.txt. Crawl-delay leest hij wel, maar hij begrenst die, zodat een scan in minuten klaar is in plaats van uren.
- Hij wacht tussen verzoeken aan dezelfde host en leest per bezoek een beperkt aantal pagina's.
- Hij stuurt If-None-Match / If-Modified-Since, zodat een ongewijzigde pagina met een goedkope 304 beantwoord wordt.
- Hij respecteert noindex in een robots-metatag of een X-Robots-Tag-header op de sites die daarom vragen.
Zelf blokkeren
Regel je dit liever in je eigen configuratie? Zet dit in robots.txt en TextWardenBot blijft weg van de paden die je noemt.
User-agent: TextWardenBot
Disallow: /
Of meld je hier af
Liever een schakelaar die je niet hoeft te onderhouden? Geef het domein op en Taalwacht haalt er nergens meer iets van op: niet bij geplande scans, niet bij losse scans en niet bij de openbare paginacheck. De afmelding geldt ook voor alle subdomeinen.
We sturen een bevestigingslink om te controleren dat het verzoek echt van het domein komt. Gebruik daarom een adres bij het domein dat je afmeldt.
← Terug naar home