Posts tonen met het label webarchivering. Alle posts tonen
Posts tonen met het label webarchivering. Alle posts tonen

donderdag 10 september 2015

De datum op een webpagina

9 februari 2015
Vorige week stuurde een dorpsgenoot me een berichtje met een link naar een pagina op de gemeentelijke website. Hij vroeg zich af of de datum hij zag - 9 februari 2015 - wel klopte. Toen ik die pagina op mijn tablet opende, stond er echter 2 september 2015 als datum. We wisselden wat screenshots uit (vergelijkbaar met de plaatjes hierboven en beneden), ik opende de pagina op mijn laptop en keek ook maar eens naar de html-code. Overal zag ik 2 september 2015 staan.
2 september 2015
Het duurde meer dan een uur voordat mijn dorpsgenoot door had waar het verschil aan lag: de taalinstellingen van zijn telefoon stonden op Engels (VS).
En ja hoor, toen ik de taalinstellingen op mijn tablet (of in de browser op mijn laptop) op Engels (VS) zette, verscheen ook bij mij de datum 9 februari 2015.

Oh boy!

Blijkbaar worden de pagina's samengesteld uit een database waarin de datum van het besluit vastgelegd wordt als DD/MM/YYYY, in dit geval dus 02/09/2015. En blijkbaar wordt de presentatie van die pagina beïnvloed door de taalinstellingen van de browser: is het een Amerikaan die de pagina opvraagt, dan wordt de datum 9 februari, is het een Nederlander (of wie dan ook, eigenlijk) dan wordt het 2 september.

Ik heb het nog even uitgeprobeerd op andere pagina's en ja, 1 juli wordt 7 januari. Maar 15 juli, blijft gewoon 15 juli.

Om het nog wat ingewikkelder te maken: de bewuste pagina staat niet in The Internet Archive, maar als je de pagina zelf archiveert bijvoorbeeld met behulp van archive.is, of HTTrack (in de standaardinstellingen), dan krijg je de pagina met de Amerikaanse datum.

Ik hoef niet uit te leggen waarom het problematisch is als de datum op een "officiële bekendmaking" varieert, hè?

Gerelateerd
Parkeertarieven op de website
Wayback in de rechtszaal
Eisen webarchivering van de VNG

woensdag 27 november 2013

Archive.is is cool

Hierboven zie een stukje van mijn blog, zoals het er uitzag op 22 februari 2013. De hele pagina van toen, kun je zien bij Archive.is. En hier vind je het zip-bestandje dat die site gemaakt heeft, zodat je de pagina op je eigen machine kunt zetten.
Archive.is is:
your personal Wayback Machine!
It takes a "snapshot" of a webpage that will always be online even if the original page disappears.
This can be useful if you want to take a "snapshot" of a page which could change soon: price list, job offer, real estate listing, drunk blog post, ...
It saves a text and a graphical copy of the page for better accuracy.
De herkomst en duurzaamheid van de dienst is een beetje duister. Ene Denis Petrov uit Praag heeft de site geregistreerd en in de FAQ staat:
What software do you run and how data is stored?
The archive runs Apache Hadoop and Apache Accumulo. All data is stored on HDFS, textual content is duplicated 3 times among servers in different datacenters and images are duplicated 2 times. All datacenters are in Europe.
How long the page will be stored?
Virtually forever. We have a lot of free space and alhough the archive grows with time, the storage and bandwidth get cheaper.
[...]
How is the archive funded?
It is privately funded; there are no complex finances behind it. It may look more or less reliable compared to startup-style funding or a university project, depending on which risks are taken into account. My death can cause interruption of service, but something like new market conditions or changing head of a department cannot.
Maar voorlopig vind ik het een mooie website.

(En ik zal vandaag geen boze dingen zeggen over het stukje over het opslaan van overheidswebsites in dit artikel in iBestuur.)

Gerelateerd
Eisen webarchivering van de VNG
Parkeertarieven op de website
Wayback in de rechtszaal

woensdag 9 januari 2013

Eisen webarchivering van de VNG

Ach ja, GovUnited heeft voor dertien gemeenten een Programma van Eisen voor Webarchivering opgesteld en online gezet. Dat laatste siert ze, al is de inhoud van het eisenpakket hier en daar discutabel en onduidelijk. Een paar voorbeelden.
Gemeenten willen een aanbieding ontvangen voor een gebruiksvriendelijke oplossing voor webarchivering die extern wordt gehost en als webservice wordt aangeboden. Uiteraard moet de oplossing voldoen aan geldende Nederlandse wet- en regelgeving.
Waarom is externe hosting het uitgangspunt?
Zouden gemeenten dit echt niet zelf kunnen behappen?
Te weinig deskundigheid misschien?
Maar hoe kun je zonder die deskundigheid dan beoordelen of een commerciële aanbieder het wel goed doet? Voor uitbesteden heb je ook nogal wat deskundigheid nodig...
Daar komt bij dat externe hosting altijd discussies oplevert over eigenaarschap. In de eisen staat dan wel
G1 De inhoud van het webarchief blijft altijd eigendom van de gemeente. In het geval van een faillissement is voorzien in een overdrachtscenario.
Maar een leverancier gaat je echt niet van te voren bellen met de mededeling dat hij over twee weken failliet gaat.
En, nog problematischer, data worden niet als "eigendom" beschouwt. Of zoals ik Arnoud Engelfriet een paar maanden geleden citeerde:
De claim “het is mijn data en ik wil deze terug” gaat hem niet worden. Data “is” niets in de zin van de wet, en deze kan dus niet worden opgeëist.
Wat dat betreft snap ik ook de eis dat de functioneel beheerder van het webarchief fysiek toegang tot het datacentrum waar de boel bewaard wordt moet hebben, niet. Wat zou hij tussen die servers moeten doen?

In de eisen staat ook iets over open standaarden:
Het archief moet opgebouwd zijn uit open bestandsformaten.
Toelichting: O.a. over gebruik WARC containers en gerelateerde records.
Ja, WARC is de open standaard voor het beschrijven en bewaren van websites, maar WARC is een container. Daar zitten dus allerlei andere bestanden "in". Hoe zit dat met die eis voor open bestandsformaten dan voor de bestanden waar een website uit bestaat? Betekent deze eis dat er geen jpg-bestanden gearchiveerd mogen worden? Dan mogen die ook niet meer in de website gebruikt worden, lijkt me.
Overigens zijn er meer eisen die zo te zien meer eisen stellen aan de website van de aanbestedende gemeente dan aan de aannemende leverancier.
En tenslotte, over het vastleggen van metagegevens worden nauwelijks zinnige dingen geëist:
A9 Alle metadata die online uit de content te halen zijn, moeten automatisch worden overgenomen worden in het archief.
A10 Het archief moet doorzoekbaar zijn op tijdvak en webdomein.
A11 Het archief moet doorzoekbaar zijn op overige metadata die uit de online content te halen is.
A12 De zoekfunctionaliteit in het webarchief houdt rekening met de Overheid.nl Web Metadata Standaard (OWMS)
A13 Het archief is doorzoekbaar op attributen (dus ook op locatie of taal)
Dit lijkt dus ook vooral te gaan over de website en niet over het archiveren daarvan.
O en dan vergeet ik er nog twee eisen die over metagegevens gaan:
D1 Publicatie op de website kan feitelijk aangetoond worden inclusief het tijdstip en duur dat dat pagina online heeft gestaan cq staat.
D2 Het is niet mogelijk de informatie in het archief inhoudelijk aan te passen. (Zie ook F8; deze eis betreft de waarborg van de geldigheid c.q. authenticiteit)
Interessant is dan ook dat de leverancier wel een api moet leveren waarmee de gearchiveerde website(s) naar een RMA/e-depot geëxporteerd kunnen worden. Maar dan moet je wel weten welke metagegevens die ontvangende systemen nodig hebben en dus moet je zorgen dat je webarchief deze kan leveren en dus moet je dat toch iets uitgebreider bewchrijven, lijkt mij...

Hoe dan ook, nice try van GovUnited, maar er zitten nogal wat haken en ogen aan.

Gerelateerd

Het bewaren van overheidswebsites
Costa Concorda en webarchivering

Plaatje: Website is down van Sean MacEntee

vrijdag 23 november 2012

Groene IT voor een "web archief"?


De Internet Memory Foundation (voorheen European Archive) is een in 2004 opgerichte non-profit organisatie in Parijs en Amsterdam die zich richt op "het archiveren van internet." Of zoals op hun website staat:
In order to preserve significant and valuable fragments of this information deluge, we think it is necessary to build a large scale, open memory of the Internet.
This memory has to be different from a traditional archive, or library, as much as the internet is different from traditional media. It has to be large enough to be useful, neutral in it’s extension and respectful of person’s rights. We see this memory as embedded in the Internet, augmenting ways information is already used on this media (navigation, search, mining) rather than being separated. By bringing hindsight, it will become a valuable feature of the Internet itself.
Hier vind je het overzicht van de collecties die IM tot nu toe heeft aangelegd (of beheerd, dat is mij niet helemaal duidelijk.) In feite is het "gewoon" een Europese variant van The Internet Archive.
Maar daar gaat het me nu even niet om.
Eergisteren beschreef Chloé Martin op het weblog van IM de nieuwe infrastructuur van het Parijse datacenter van de organisatie. In zijn Amsterdamse datacenter gebruikte IM al servers die speciaal opgebouwd zijn uit energiezuinige onderdelen (zogenaamde red boxes). Maar in hun Parijse vestiging zijn ze nu nog een stap verder gegaan. Een groot deel van de energieconsumptie van datacenters zit in de koeling. Dus die hebben ze in Parijs maar gewoon afgeschaft!
That’s the result of improvements at several levels, including a new design of cylindrical ‘rack’, which enables a free cooling system and a lower energy consumption at all levels (servers, disks and motherboards).
The free-cooling system has been made possible due to a very low thermic diffusion (for 72 nodes, IM datacenter is set between 5300 W and 6300 W depending on the configuration of server class) and due to an innovative design, which enables natural heat extraction.
Here’s a comparison between a regular datacenter and IM datacenter:
Energy
Het nieuwe datacenter is dus een kleine acht keer zuiniger dan een standaard inrichting. Dat is nogal een verschil!

Gerelateerd
Datacenters verbruiken stroom, heel veel stroom
Papierloos en milieuvriendelijk? Dacht het niet... #archivecamp

Het filmpje vond ik in het European Archive in de collectie van TNA en is een Brits "Postbus 51"-filmpje uit de jaren veertig. Helaas is embedden vanuit European Archive (nog) niet mogelijk.

dinsdag 9 oktober 2012

De geschiedenisrecorder van Piek Vossen


De afgelopen jaren is er meer informatie verloren gegaan dan in de eeuwen ervoor. Dat heeft deels te maken met het feit dat alles wat op het web komt niet per se gearchiveerd wordt. De geschiedenisrecorder past daarom in het tijdperk waarin data steeds belangrijker worden. Taalwetenschapper Piek Vossen, hoogleraar computationele lexicologie, ontwikkelde de recorder.

Vossen is naast hoogleraar ook programmeur. In die hoedanigheid heb ik hem ook leren kennen, als CTO van taaltechnologisch bedrijf Irion. Hij heeft de recorder zelf gebouwd. De machine verwerkt teksten in vier talen (Nederlands, Engels, Spaans en Italiaans) en analyseert tot welk thema ze horen. Het verzamelt alle feiten uit alle media in een bepaalde periode, en toont de afhankelijkheden, de verschillen en de overeenkomsten. Zo wordt een compleet overzicht van een bepaald thema gecreëerd. De geschiedenisrecorder fungeert als het ware als het geheugen van het semantische web, maar ook van alle offline media. (Extended Limits)
Vossen was gisteravond bij Casa Luna, het volledige gesprek kun je hier beluisteren.

maandag 8 oktober 2012

cRIsp - samen representatie-informatie verzamelen

Een van de (vele) problemen bij digitale archivering is alle informatie die je over de digitale archiefstukken moet hebben en kennen om ze kunnen raadplegen en begrijpen. Het Open Archival Information System (OAIS, laatste versie in pdf) beschrijft deze (context)informatie als Representation Information (RI) definieert het als:
The information that maps a Data Object into more meaningful concepts. An example of Representation Information for a bit sequence which is a FITS file might consist of the FITS standard which defines the format plus a dictionary which defines the meaning in the file of keywords which are not part of the standard.
Deze RI kan allerlei vormen hebben. In OAIS worden in ieder geval semantische informatie, structurele informatie en alle overige benodigde informatie beschreven. De omschrijving van die laatste categorie laat zien dat bij digitale archiefbescheiden bijna alles RI is of kan zijn:
Representation Information which cannot easily be classified as Semantic or Structural. For example software, algorithms, encryption, written instructions and many other things may be needed to understand the Content Data Object, all of which therefore would be, by definition, Representation Information, yet would not obviously be either Structure or Semantics. Information defining how the Structure and the Semantic Information relate to each other, or software needed to process a database file would also be regarded as Other Representation Information.
En uiteraard gaat het hier ook weer om wat ik ergens anders het Droste-effect genoemd heb:
Representation Network: The set of Representation Information that fully describes the meaning of a Data Object. Representation Information in digital forms needs additional Representation Information so its digital forms can be understood over the Long Term.
Aangezien RI zo cruciaal is voor alle digitale archivering, ligt het voor de hand dat er al allerlei "registers" zijn waar deze informatie in beschreven wordt: PRONOM, GDFR en wat niet al.
Al die registers hebben volgens Andrew N. Jackson, Maureen Pennock en Paul Wheatley een of meer van de volgende tekortkomingen

Crowdsourcing Representation Information to Support Preservation: CRISP from mopennock

Hun oplossing is eigenlijk hartstikke simpel, daarom sympathiek en misschien wel geniaal:
cRIsp - Crowd sourced Representation Information for Supporting Preservation
cRIsp is aiming to combat these challenges by drawing upon the wisdom and knowledge of the crowd to identify online sources of RI, and then collect, classify, and preserve them. We've aimed to set the barrier for participation as low as possible. Anyone can easily contribute URLs via a really simple web form, or by tweeting and including @dpref. The collated results will then be passed to participating web archives who can crawl the sites and preserve them for posterity.
Het idee is dat iedereen die op het web relevante informatie vindt, deze aan cRIsp kan toevoegen. Dat kan door een tweet te sturen naar @dpref:
Maar je kunt ook een bookmarklet gebruiken of een simpel Google-form.
Het resultaat is voorlopig een Google-sheet waarin alle links verzameld wordt, daarna zullen alle relevante webpagina's bewaard worden.
En daarna?
The resulting collection of RI will hopefully be a useful resource in its own right, but will represent only the first step on the road to powerful RI and file format registries. cRIsp is all about finding the RI and making it safe. The results of cRIsp can then feed into other initiatives such as theLoC's Sustainability of Digital Formats site, Just Solve the Format Problem and the UDFR. In this way, we hope that cRIsp will be quite complimentary to these other approaches.
 Ik vind het in ieder geval prachtig in zijn eenvoud...

Gerelateerd
November is bestandsformatenmaand
Costa Concordia en webarchivering
Filmpje over website-archivering en IIPC

woensdag 19 september 2012

Red een website met de Archive Team Warrior

Terwijl Christian de zeebodem afstruint op zoek naar zeesterren, sponzen, vissen en schelpdingen, probeer ik internet te redden.
In The save button ruined everything (luisteren, het is de moeite waard!) hoorde ik Jason Scott iets zeggen over het installeren van de Archive Team Warrior, waarmee je zelf kunt bijdragen aan het redden van websites die "at risk zijn"
Gisteren heb ik de Warrior gedownload en geïnstalleerd en eerlijk gezegd is dat hartstikke simpel (zelfs als je VirtualBox nog niet geïnstalleerd hebt).
Daarna kun je kiezen welke website je graag zou willen redden.
Op dit moment valt er niets te kiezen: de forums van City of Heroes moeten gered worden. Mij zegt 't niets, maar het gaat om het idee.

Enige minpunt is: volgens mij werkt het niet...

Ik slaag er maar niet in om iets te redden, doordat ik steeds tegen een "tracker rate limit" aan loop.
Geen idee waar dat aan ligt, dus als iemand van jullie het weet?

Gerelateerd
Over het maken van soja-saus en het bewaren van websites
November is bestandsformaten-maand

dinsdag 8 mei 2012

Parkeertarieven op de website

Ha, een mooie uitspraak van de rechtbank over de waarde en status van de informatie op een gemeentelijke website.
Een inwoonster van Eindhoven weigert de "naheffingsaanslag parkeerbelasting" [gewone mensen noemen dit een parkeerboete] te betalen, omdat de informatie over de parkeertijden op de gemeentelijke website niet strookte met de informatie op de parkeerautomaat.
De rechter stelt haar in het gelijk en stelt dat de disclaimer die op de website stond, helemaal niet relevant is.
Zij heeft daar haar auto geparkeerd, ervan uitgaande dat de informatie van de gemeente op de door haar geraadpleegde website correct zou zijn. Zodoende heeft zij niet meer op de betaalautomaat gekeken. Naderhand werd zij geconfronteerd met de omstandigheid dat de informatie op de website niet juist bleek te zijn.
Eiseres is van mening dat zij als burger op de informatie op de website van de gemeente over het parkeerbeleid mag vertrouwen, te meer daar te dezer zake in het informatieblad van de gemeente expliciet naar de website wordt verwezen.
Verweerder heeft hiertegen aangevoerd dat eiseres aan de foutieve informatie op de website geen rechten kan ontlenen. Hij wijst in dit verband op de melding op de website, dat niet gegarandeerd kan worden dat informatie in alle gevallen foutloos, volledig en actueel is, alsmede op het bepaalde in de Verordening op de heffing en invordering van parkeerbelastingen 2005, waarin staat dat van de verschuldigde belasting kennis wordt gegeven op de parkeerapparatuur.
De parkeerautomaat aan de [straat] vermeldt de correcte informatie, inhoudende dat parkeerbelasting verschuldigd is op maandag tot en met zaterdag van 09.00 uur tot 21.00 uur.
De rechtbank overweegt als volgt.
Vaststaat dat in het juni/juli nummer 2005 van "[woonplaats] dichterbij", het informatieblad voor de inwoners van die gemeente, in een artikel over het parkeerbeleid specifiek wordt vermeld : "Kijk voor meer informatie over tarieven en parkeermogelijkheden op www.eindhoven.nl". Niet bestreden is dat eiseres, voordat zij op 8 juni 2005 haar auto parkeerde aan de [straat], die website heeft geraadpleegd en dat die website foutieve informatie bevat(te) met betrekking tot de aldaar geldende parkeertijden.
Niet bestreden is voorts dat de parkeerautomaat aan de [straat], met daarop de juiste informatie met betrekking tot de ter plaatse geldende parkeertijden, niet in de looproute van eiseres stond.
Gelet op deze omstandigheden, in onderling verband bezien, hoefde van eiseres niet te worden verwacht alvorens de stad in te gaan zich nog op de hoogte te stellen van de parkeertijden betaald parkeren, die op de parkeerautomaat vermeld stonden.
De omstandigheid dat de website van de gemeente [woonplaats] een zogeheten 'disclaimer' bevat doet hieraan niet af. Het risico van foutieve informatie op de website dient in het onderhavige geval voor rekening van verweerder te worden gelaten.
De naheffingsaanslag parkeerbelasting is derhalve ten onrechte opgelegd.
Overigens dateert deze uitspraak al uit 2006.

Met dank aan collega Sam.

Gerelateerd
Websites archiveren of websites verzamelen
Costa Concordia en webarchivevering
Wayback in de rechtszaal

Plaatje: Parkeermeter van Ernst Wallinga