Docs Content & antwoorden

De crawler en je content

Een crawler, ook wel een webcrawler of bot genoemd, is een geautomatiseerd programma dat websites bezoekt en hun inhoud analyseert. Crawlers worden vaak gebruikt door zoekmachines om webpagina's te indexeren, maar ze kunnen ook worden ingezet voor andere doeleinden, zoals het verzamelen van informatie voor AI-systemen.

Wat doet de vragen.ai-crawler?

De vragen.ai-crawler wordt gebruikt om relevante informatie van je website op te halen en te verwerken. Dit stelt onze AI in staat om nauwkeurige en up-to-date antwoorden te geven op vragen die gebruikers stellen. De crawler volgt de richtlijnen die zijn ingesteld in het robots.txt-bestand en respecteert standaard crawling-intervals om de serverbelasting te minimaliseren.

Hoe blijft je content actueel?

De crawler bezoekt je website regelmatig opnieuw en pikt gewijzigde pagina's automatisch op. Reken erop dat een wijziging op je website binnen 1 à 2 uur in de antwoorden is verwerkt. Een compleet nieuwe bron begint na ongeveer een uur met crawlen; het duurt daarna nog even voordat alle pagina's zijn ingelezen.

Wil je niet wachten, of controleren of een pagina goed is ingelezen? Log in op je omgeving (de Login-knop staat bovenaan deze website) en open je kennisbank. Daar zie je welke pagina's en documenten zijn ingelezen en kun je zelf een nieuwe crawl aanvragen. Lukt het niet of gaat het om een lastiger geval? Mail dan naar service@vragen.ai.

Niet elke pagina van je website telt mee. Pagina's die je met een URL-patroon of robots.txt hebt uitgesloten, worden overgeslagen. Het totale aantal pagina's op je site is dus niet gelijk aan het aantal geïndexeerde documenten in je kennisbank.

User Agent

Onze crawler identificeert zichzelf met de volgende User Agent:

Vragenai

Je kan onze crawler herkennen in de serverlogs van je website aan deze User Agent.

IP-adressen van de crawler

De vragen.ai-crawler maakt gebruik van een vast IP-bereik om verzoeken naar je website te sturen. Dit maakt het mogelijk om toegang op serverniveau te beheren.

Alle crawlerverzoeken komen momenteel van de volgende IP-adressen:

87.233.245.192/28

Let op: de gebruikte IP-adressen kunnen in de toekomst wijzigen. Indien er een wijziging plaatsvindt, ontvangt je hiervan een melding zodat je eventuele aanpassingen in je configuratie kunt doorvoeren.

Hoe kan je de vragen.ai-crawler beheren?

Robots.txt-instellingen

Je kan het gedrag van de vragen.ai-crawler beheren door regels toe te voegen aan je robots.txt-bestand. Bijvoorbeeld:

User-agent: Vragenai
Disallow: /private-folder/

Dit voorkomt dat de crawler de map /private-folder/ bezoekt.

Crawl-snelheid aanpassen

Onze crawler respecteert crawl-delay-richtlijnen indien deze in robots.txt zijn gedefinieerd. Bijvoorbeeld:

User-agent: Vragenai
Crawl-delay: 10

Hiermee wordt ingesteld dat de crawler minstens 10 seconden wacht tussen opeenvolgende verzoeken.

De crawler toestaan in je firewall

Firewalls en botbescherming (zoals Cloudflare) beschermen websites tegen ongewenste bots, maar kunnen daarbij ook legitieme crawlers zoals die van vragen.ai blokkeren. Door de crawler te white-listen, zorg je ervoor dat je content zonder onderbrekingen geïndexeerd kan worden.

Combineer in de regel altijd de User Agent én het IP-bereik van de crawler (beide staan hierboven). Een regel op alleen de User Agent is te ruim: die tekst kan iedereen meesturen. De combinatie laat alleen onze echte crawler door.

Stappenplan voor Cloudflare

  1. Ga naar Cloudflare Dashboard, log in en selecteer de juiste website.

  2. Navigeer naar Security > WAF (Web Application Firewall).

  3. Ga naar Custom Rules en klik op Create Rule. Geef de regel een naam, bijvoorbeeld: Whitelist Vragenai Crawler.

  4. Stel de regel in met twee voorwaarden, gecombineerd met And:

    • Field: User-Agent, Operator: contains, Value: Vragenai

    • Field: IP Source Address, Operator: is in, Value: 87.233.245.192/28

  5. Kies bij Action: Allow en klik op Deploy Rule.

Wil je liever met IP Access Rules werken, dan kan dat ook: ga naar Security > WAF > Tools, voeg onder IP Access Rules het IP-bereik van de crawler toe en stel de actie in op Allow.

Wordt de crawler nog steeds geblokkeerd?

Controleer of er andere regels actief zijn die bots blokkeren, zoals Bot Fight Mode of Rate Limiting, en pas die instellingen aan indien nodig. Gebruik je een andere firewall of WAF dan Cloudflare? Het recept is hetzelfde: sta de combinatie van User Agent en IP-bereik toe. Je herkent een blokkade aan geweigerde verzoeken (bijvoorbeeld 403-fouten) van de User Agent Vragenai in je serverlogs.

Als het crawlen tijdelijk stopt ("systeem gepauzeerd")

Loopt de crawler in korte tijd tegen te veel fouten aan, dan pauzeert vragen.ai het inlezen automatisch. Je ziet dan de melding "Systeem tijdelijk gepauzeerd". Dat is een ingebouwde beveiliging: zo blijven we niet onnodig verzoeken sturen naar een site die ze op dat moment niet goed afhandelt.

Meestal ligt de oorzaak aan de kant van je website:

  • Een firewall of botbescherming blokkeert de crawler. Sta hem toe zoals hierboven beschreven (User Agent én IP-bereik).

  • De sitemap gebruikt http:// in plaats van https://. Elke URL leidt dan tot een omleiding en een extra verzoek. Laat de sitemap op https zetten.

  • De server geeft time-outs of foutmeldingen. Controleer of je website de crawlbelasting aankan.

Is de oorzaak weg, dan hervatten we het crawlen. Kom je er niet uit, mail dan naar service@vragen.ai; we kijken mee en zetten het voor je weer aan.

Wat als ik problemen ondervind?

Als je vragen hebt of ongewenst crawlgedrag ervaart, kan je contact opnemen met ons supportteam via service@vragen.ai.

Niet gevonden wat je zocht?

Stel je vraag direct aan vragen.ai.

Wat is vragen.ai precies?

Voorbeeldantwoord door vragen.ai

vragen.ai laat bezoekers hun vraag stellen op je website en geeft direct een betrouwbaar antwoord uit je eigen content, met de bron erbij. Je bepaalt zelf welke bronnen de AI gebruikt.

Bron: Hoe het werkt

Dit is een voorbeeld. De interactieve widget kon hier niet laden, bijvoorbeeld door een scriptblokker of trage verbinding.

Je stelt je vraag aan een AI-assistent van vragen.ai. Antwoorden komen uit onze eigen content, met de bron erbij. Waarom we dit melden