De crawler en je content
Een crawler, ook wel een webcrawler of bot genoemd, is een geautomatiseerd programma dat websites bezoekt en hun inhoud analyseert. Crawlers worden vaak gebruikt door zoekmachines om webpagina's te indexeren, maar ze kunnen ook worden ingezet voor andere doeleinden, zoals het verzamelen van informatie voor AI-systemen.
Wat doet de vragen.ai-crawler?
De vragen.ai-crawler wordt gebruikt om relevante informatie van je website op te halen en te verwerken. Dit stelt onze AI in staat om nauwkeurige en up-to-date antwoorden te geven op vragen die gebruikers stellen. De crawler volgt de richtlijnen die zijn ingesteld in het robots.txt-bestand en respecteert standaard crawling-intervals om de serverbelasting te minimaliseren.
Hoe blijft je content actueel?
De crawler bezoekt je website regelmatig opnieuw en pikt gewijzigde pagina's automatisch op. Reken erop dat een wijziging op je website binnen 1 à 2 uur in de antwoorden is verwerkt. Een compleet nieuwe bron begint na ongeveer een uur met crawlen; het duurt daarna nog even voordat alle pagina's zijn ingelezen.
Wil je niet wachten, of controleren of een pagina goed is ingelezen? Log in op je omgeving (de Login-knop staat bovenaan deze website) en open je kennisbank. Daar zie je welke pagina's en documenten zijn ingelezen en kun je zelf een nieuwe crawl aanvragen. Lukt het niet of gaat het om een lastiger geval? Mail dan naar service@vragen.ai.
Niet elke pagina van je website telt mee. Pagina's die je met een URL-patroon of robots.txt hebt uitgesloten, worden overgeslagen. Het totale aantal pagina's op je site is dus niet gelijk aan het aantal geïndexeerde documenten in je kennisbank.
User Agent
Onze crawler identificeert zichzelf met de volgende User Agent:
Vragenai
Je kan onze crawler herkennen in de serverlogs van je website aan deze User Agent.
IP-adressen van de crawler
De vragen.ai-crawler maakt gebruik van een vast IP-bereik om verzoeken naar je website te sturen. Dit maakt het mogelijk om toegang op serverniveau te beheren.
Alle crawlerverzoeken komen momenteel van de volgende IP-adressen:
87.233.245.192/28
Let op: de gebruikte IP-adressen kunnen in de toekomst wijzigen. Indien er een wijziging plaatsvindt, ontvangt je hiervan een melding zodat je eventuele aanpassingen in je configuratie kunt doorvoeren.
Hoe kan je de vragen.ai-crawler beheren?
Robots.txt-instellingen
Je kan het gedrag van de vragen.ai-crawler beheren door regels toe te voegen aan je robots.txt-bestand. Bijvoorbeeld:
User-agent: Vragenai
Disallow: /private-folder/
Dit voorkomt dat de crawler de map /private-folder/ bezoekt.
Crawl-snelheid aanpassen
Onze crawler respecteert crawl-delay-richtlijnen indien deze in robots.txt zijn gedefinieerd. Bijvoorbeeld:
User-agent: Vragenai
Crawl-delay: 10
Hiermee wordt ingesteld dat de crawler minstens 10 seconden wacht tussen opeenvolgende verzoeken.
De crawler toestaan in je firewall
Firewalls en botbescherming (zoals Cloudflare) beschermen websites tegen ongewenste bots, maar kunnen daarbij ook legitieme crawlers zoals die van vragen.ai blokkeren. Door de crawler te white-listen, zorg je ervoor dat je content zonder onderbrekingen geïndexeerd kan worden.
Combineer in de regel altijd de User Agent én het IP-bereik van de crawler (beide staan hierboven). Een regel op alleen de User Agent is te ruim: die tekst kan iedereen meesturen. De combinatie laat alleen onze echte crawler door.
Stappenplan voor Cloudflare
-
Ga naar Cloudflare Dashboard, log in en selecteer de juiste website.
-
Navigeer naar Security > WAF (Web Application Firewall).
-
Ga naar Custom Rules en klik op Create Rule. Geef de regel een naam, bijvoorbeeld:
Whitelist Vragenai Crawler. -
Stel de regel in met twee voorwaarden, gecombineerd met And:
-
Field:
User-Agent, Operator:contains, Value:Vragenai -
Field:
IP Source Address, Operator:is in, Value:87.233.245.192/28
-
-
Kies bij Action:
Allowen klik op Deploy Rule.
Wil je liever met IP Access Rules werken, dan kan dat ook: ga naar Security > WAF > Tools, voeg onder IP Access Rules het IP-bereik van de crawler toe en stel de actie in op Allow.
Wordt de crawler nog steeds geblokkeerd?
Controleer of er andere regels actief zijn die bots blokkeren, zoals Bot Fight Mode of Rate Limiting, en pas die instellingen aan indien nodig. Gebruik je een andere firewall of WAF dan Cloudflare? Het recept is hetzelfde: sta de combinatie van User Agent en IP-bereik toe. Je herkent een blokkade aan geweigerde verzoeken (bijvoorbeeld 403-fouten) van de User Agent Vragenai in je serverlogs.
Als het crawlen tijdelijk stopt ("systeem gepauzeerd")
Loopt de crawler in korte tijd tegen te veel fouten aan, dan pauzeert vragen.ai het inlezen automatisch. Je ziet dan de melding "Systeem tijdelijk gepauzeerd". Dat is een ingebouwde beveiliging: zo blijven we niet onnodig verzoeken sturen naar een site die ze op dat moment niet goed afhandelt.
Meestal ligt de oorzaak aan de kant van je website:
-
Een firewall of botbescherming blokkeert de crawler. Sta hem toe zoals hierboven beschreven (User Agent én IP-bereik).
-
De sitemap gebruikt
http://in plaats vanhttps://. Elke URL leidt dan tot een omleiding en een extra verzoek. Laat de sitemap ophttpszetten. -
De server geeft time-outs of foutmeldingen. Controleer of je website de crawlbelasting aankan.
Is de oorzaak weg, dan hervatten we het crawlen. Kom je er niet uit, mail dan naar service@vragen.ai; we kijken mee en zetten het voor je weer aan.
Wat als ik problemen ondervind?
Als je vragen hebt of ongewenst crawlgedrag ervaart, kan je contact opnemen met ons supportteam via service@vragen.ai.