Ga naar inhoud
Informatiebeheer & Archivering

Waarom blokkeert mijn website de webarchief-crawler, en hoe los je dat op?

Beveiligingsmaatregelen zoals een WAF of bot-protectie kunnen de webarchief-crawler blokkeren. Dit artikel legt uit hoe je de crawler whitelist op user-agent, met voorbeelden voor Cloudflare, Nginx en Apache.

Bij het archiveren van een website kan het voorkomen dat de crawler wordt tegengehouden door beveiligingsmaatregelen die eigenlijk bedoeld zijn om de website te beschermen. Het resultaat: een onvolledig of incorrect webarchief.

Wat er misgaat

Beveiligingsmaatregelen die geautomatiseerd verkeer blokkeren of beperken, zijn een veelvoorkomende oorzaak:

  • Web Application Firewalls (WAF)
  • bot-protectie
  • rate limiting
  • anti-DDoS-maatregelen
  • CDN-beveiliging
  • CMS-security plugins

Dit uit zich in het webarchief als:

  • ontbrekende pagina's
  • niet geladen afbeeldingen, CSS of JavaScript
  • foutmeldingen of blokkadepagina's
  • onvolledige replay van het archief

De oplossing: whitelisten op user-agent

Om een correcte en volledige archivering mogelijk te maken, whitelist je de crawler op basis van de HTTP User-Agent. Sta requests toe waarbij de User-Agent de term webarchief_crawler bevat.

Let op: de controle moet gebaseerd zijn op contains, includes of een reguliere expressie, en niet op een exacte stringvergelijking (exact match). De volledige User-Agent-string kan namelijk meer bevatten dan alleen deze term.

Waarom geen IP-whitelisting

IP-whitelisting is geen geschikte methode voor deze uitzondering. De infrastructuur die crawlt maakt gebruik van dynamische en schaalbare cloudomgevingen, waardoor het verkeer niet van een vaste set statische IP-adressen afkomstig is. Een IP-gebaseerde uitzondering werkt daardoor niet betrouwbaar.

Voorbeeldconfiguraties

Cloudflare (WAF-regel)

(http.user_agent contains "webarchief_crawler")

Nginx

if ($http_user_agent ~* "webarchief_crawler") {
    set $skip_waf 1;
}

Apache

SetEnvIfNoCase User-Agent "webarchief_crawler" allow_archive_bot

Waarom deze uitzondering nodig is

Deze whitelisting is uitsluitend bedoeld om de website conform de Archiefwet, de Richtlijn Archiveren Overheidswebsites en de eigen informatiebeheerdoelstellingen volledig, betrouwbaar en reproduceerbaar te kunnen archiveren. Het opent geen bredere toegang tot de website: alleen verkeer met deze specifieke User-Agent wordt uitgezonderd van de beveiligingsmaatregel.

Wie moet dit instellen?

Dit is meestal werk voor de technisch beheerder van de website of hosting, niet voor de informatiebeheerder. Zorg dat deze whitelisting is toegepast voordat een website voor het eerst wordt gearchiveerd, zodat de eerste, initiële capture al volledig is.

Verwante artikelen