Waarom blokkeert mijn website de webarchief-crawler, en hoe los je dat op?
Beveiligingsmaatregelen zoals een WAF of bot-protectie kunnen de webarchief-crawler blokkeren. Dit artikel legt uit hoe je de crawler whitelist op user-agent, met voorbeelden voor Cloudflare, Nginx en Apache.
Bij het archiveren van een website kan het voorkomen dat de crawler wordt tegengehouden door beveiligingsmaatregelen die eigenlijk bedoeld zijn om de website te beschermen. Het resultaat: een onvolledig of incorrect webarchief.
Wat er misgaat
Beveiligingsmaatregelen die geautomatiseerd verkeer blokkeren of beperken, zijn een veelvoorkomende oorzaak:
- Web Application Firewalls (WAF)
- bot-protectie
- rate limiting
- anti-DDoS-maatregelen
- CDN-beveiliging
- CMS-security plugins
Dit uit zich in het webarchief als:
- ontbrekende pagina's
- niet geladen afbeeldingen, CSS of JavaScript
- foutmeldingen of blokkadepagina's
- onvolledige replay van het archief
De oplossing: whitelisten op user-agent
Om een correcte en volledige archivering mogelijk te maken, whitelist je de crawler op basis van de HTTP User-Agent. Sta requests toe waarbij de User-Agent de term webarchief_crawler bevat.
Let op: de controle moet gebaseerd zijn op contains, includes of een reguliere expressie, en niet op een exacte stringvergelijking (exact match). De volledige User-Agent-string kan namelijk meer bevatten dan alleen deze term.
Waarom geen IP-whitelisting
IP-whitelisting is geen geschikte methode voor deze uitzondering. De infrastructuur die crawlt maakt gebruik van dynamische en schaalbare cloudomgevingen, waardoor het verkeer niet van een vaste set statische IP-adressen afkomstig is. Een IP-gebaseerde uitzondering werkt daardoor niet betrouwbaar.
Voorbeeldconfiguraties
Cloudflare (WAF-regel)
(http.user_agent contains "webarchief_crawler")
Nginx
if ($http_user_agent ~* "webarchief_crawler") {
set $skip_waf 1;
}
Apache
SetEnvIfNoCase User-Agent "webarchief_crawler" allow_archive_bot
Waarom deze uitzondering nodig is
Deze whitelisting is uitsluitend bedoeld om de website conform de Archiefwet, de Richtlijn Archiveren Overheidswebsites en de eigen informatiebeheerdoelstellingen volledig, betrouwbaar en reproduceerbaar te kunnen archiveren. Het opent geen bredere toegang tot de website: alleen verkeer met deze specifieke User-Agent wordt uitgezonderd van de beveiligingsmaatregel.
Wie moet dit instellen?
Dit is meestal werk voor de technisch beheerder van de website of hosting, niet voor de informatiebeheerder. Zorg dat deze whitelisting is toegepast voordat een website voor het eerst wordt gearchiveerd, zodat de eerste, initiële capture al volledig is.
Verwante artikelen
Webarchief in dip Insights
Overheden zijn op grond van de Archiefwet verplicht om informatie die zij publiceren bij het uitvoeren van hun taken te archiveren.
Wat is de selectielijst, en wat betekent die voor je websites?
De selectielijst is geen intern document dat je zelf verzint, maar een wettelijk instrument onder de Archiefwet. Dit artikel legt uit wat een selectielijst inhoudt, en hoe je die vertaalt naar concrete archiveringskeuzes per website.