Posts tonen met het label website archivering. Alle posts tonen
Posts tonen met het label website archivering. Alle posts tonen

woensdag 27 november 2013

Archive.is is cool

Hierboven zie een stukje van mijn blog, zoals het er uitzag op 22 februari 2013. De hele pagina van toen, kun je zien bij Archive.is. En hier vind je het zip-bestandje dat die site gemaakt heeft, zodat je de pagina op je eigen machine kunt zetten.
Archive.is is:
your personal Wayback Machine!
It takes a "snapshot" of a webpage that will always be online even if the original page disappears.
This can be useful if you want to take a "snapshot" of a page which could change soon: price list, job offer, real estate listing, drunk blog post, ...
It saves a text and a graphical copy of the page for better accuracy.
De herkomst en duurzaamheid van de dienst is een beetje duister. Ene Denis Petrov uit Praag heeft de site geregistreerd en in de FAQ staat:
What software do you run and how data is stored?
The archive runs Apache Hadoop and Apache Accumulo. All data is stored on HDFS, textual content is duplicated 3 times among servers in different datacenters and images are duplicated 2 times. All datacenters are in Europe.
How long the page will be stored?
Virtually forever. We have a lot of free space and alhough the archive grows with time, the storage and bandwidth get cheaper.
[...]
How is the archive funded?
It is privately funded; there are no complex finances behind it. It may look more or less reliable compared to startup-style funding or a university project, depending on which risks are taken into account. My death can cause interruption of service, but something like new market conditions or changing head of a department cannot.
Maar voorlopig vind ik het een mooie website.

(En ik zal vandaag geen boze dingen zeggen over het stukje over het opslaan van overheidswebsites in dit artikel in iBestuur.)

Gerelateerd
Eisen webarchivering van de VNG
Parkeertarieven op de website
Wayback in de rechtszaal

maandag 4 februari 2013

Weblog.nl is gered

Hierboven zie je mijn "Archive Team Warrior" die een paar dagen geleden bezig was met het redden van Weblog.nl. De eigenaar van Weblog.nl heeft namelijk besloten om de stekker uit weblog.nl te trekken.
In het bovenste vak zie je dat hij de links van neering.weblog.nl aan het downloaden is en in het onderste zie je dat de warc-file van henenmarontour.weblog.nl wordt geupload. De afgelopen veertien dagen heb ik op deze manier een stuk of 250 websites gered. Van onnozele sites over teckels en half-naakte vrouwen, tot reisblogs en ontroerende sites over zieke kinderen.

Gisteren tussen 18:00 en 19:00 uur was het zover, alle 35.188 websites waren gedownload!
In precies twee weken (tussen 20 januari en 3 februari) hebben in totaal 56 "warriors" 1172 GB gered. De aliassen van alle warriors kun je nalezen op de tracker en het doet me deugd dat ik hier toch een man of acht van ken.
De komende weken zullen alle weblog-sites worden toegevoegd aan de ArchiveTeam-collectie van The Internet Archive. 

Mission accomplished!

Gerelateerd

woensdag 9 januari 2013

Eisen webarchivering van de VNG

Ach ja, GovUnited heeft voor dertien gemeenten een Programma van Eisen voor Webarchivering opgesteld en online gezet. Dat laatste siert ze, al is de inhoud van het eisenpakket hier en daar discutabel en onduidelijk. Een paar voorbeelden.
Gemeenten willen een aanbieding ontvangen voor een gebruiksvriendelijke oplossing voor webarchivering die extern wordt gehost en als webservice wordt aangeboden. Uiteraard moet de oplossing voldoen aan geldende Nederlandse wet- en regelgeving.
Waarom is externe hosting het uitgangspunt?
Zouden gemeenten dit echt niet zelf kunnen behappen?
Te weinig deskundigheid misschien?
Maar hoe kun je zonder die deskundigheid dan beoordelen of een commerciële aanbieder het wel goed doet? Voor uitbesteden heb je ook nogal wat deskundigheid nodig...
Daar komt bij dat externe hosting altijd discussies oplevert over eigenaarschap. In de eisen staat dan wel
G1 De inhoud van het webarchief blijft altijd eigendom van de gemeente. In het geval van een faillissement is voorzien in een overdrachtscenario.
Maar een leverancier gaat je echt niet van te voren bellen met de mededeling dat hij over twee weken failliet gaat.
En, nog problematischer, data worden niet als "eigendom" beschouwt. Of zoals ik Arnoud Engelfriet een paar maanden geleden citeerde:
De claim “het is mijn data en ik wil deze terug” gaat hem niet worden. Data “is” niets in de zin van de wet, en deze kan dus niet worden opgeëist.
Wat dat betreft snap ik ook de eis dat de functioneel beheerder van het webarchief fysiek toegang tot het datacentrum waar de boel bewaard wordt moet hebben, niet. Wat zou hij tussen die servers moeten doen?

In de eisen staat ook iets over open standaarden:
Het archief moet opgebouwd zijn uit open bestandsformaten.
Toelichting: O.a. over gebruik WARC containers en gerelateerde records.
Ja, WARC is de open standaard voor het beschrijven en bewaren van websites, maar WARC is een container. Daar zitten dus allerlei andere bestanden "in". Hoe zit dat met die eis voor open bestandsformaten dan voor de bestanden waar een website uit bestaat? Betekent deze eis dat er geen jpg-bestanden gearchiveerd mogen worden? Dan mogen die ook niet meer in de website gebruikt worden, lijkt me.
Overigens zijn er meer eisen die zo te zien meer eisen stellen aan de website van de aanbestedende gemeente dan aan de aannemende leverancier.
En tenslotte, over het vastleggen van metagegevens worden nauwelijks zinnige dingen geëist:
A9 Alle metadata die online uit de content te halen zijn, moeten automatisch worden overgenomen worden in het archief.
A10 Het archief moet doorzoekbaar zijn op tijdvak en webdomein.
A11 Het archief moet doorzoekbaar zijn op overige metadata die uit de online content te halen is.
A12 De zoekfunctionaliteit in het webarchief houdt rekening met de Overheid.nl Web Metadata Standaard (OWMS)
A13 Het archief is doorzoekbaar op attributen (dus ook op locatie of taal)
Dit lijkt dus ook vooral te gaan over de website en niet over het archiveren daarvan.
O en dan vergeet ik er nog twee eisen die over metagegevens gaan:
D1 Publicatie op de website kan feitelijk aangetoond worden inclusief het tijdstip en duur dat dat pagina online heeft gestaan cq staat.
D2 Het is niet mogelijk de informatie in het archief inhoudelijk aan te passen. (Zie ook F8; deze eis betreft de waarborg van de geldigheid c.q. authenticiteit)
Interessant is dan ook dat de leverancier wel een api moet leveren waarmee de gearchiveerde website(s) naar een RMA/e-depot geëxporteerd kunnen worden. Maar dan moet je wel weten welke metagegevens die ontvangende systemen nodig hebben en dus moet je zorgen dat je webarchief deze kan leveren en dus moet je dat toch iets uitgebreider bewchrijven, lijkt mij...

Hoe dan ook, nice try van GovUnited, maar er zitten nogal wat haken en ogen aan.

Gerelateerd

Het bewaren van overheidswebsites
Costa Concorda en webarchivering

Plaatje: Website is down van Sean MacEntee

maandag 8 oktober 2012

cRIsp - samen representatie-informatie verzamelen

Een van de (vele) problemen bij digitale archivering is alle informatie die je over de digitale archiefstukken moet hebben en kennen om ze kunnen raadplegen en begrijpen. Het Open Archival Information System (OAIS, laatste versie in pdf) beschrijft deze (context)informatie als Representation Information (RI) definieert het als:
The information that maps a Data Object into more meaningful concepts. An example of Representation Information for a bit sequence which is a FITS file might consist of the FITS standard which defines the format plus a dictionary which defines the meaning in the file of keywords which are not part of the standard.
Deze RI kan allerlei vormen hebben. In OAIS worden in ieder geval semantische informatie, structurele informatie en alle overige benodigde informatie beschreven. De omschrijving van die laatste categorie laat zien dat bij digitale archiefbescheiden bijna alles RI is of kan zijn:
Representation Information which cannot easily be classified as Semantic or Structural. For example software, algorithms, encryption, written instructions and many other things may be needed to understand the Content Data Object, all of which therefore would be, by definition, Representation Information, yet would not obviously be either Structure or Semantics. Information defining how the Structure and the Semantic Information relate to each other, or software needed to process a database file would also be regarded as Other Representation Information.
En uiteraard gaat het hier ook weer om wat ik ergens anders het Droste-effect genoemd heb:
Representation Network: The set of Representation Information that fully describes the meaning of a Data Object. Representation Information in digital forms needs additional Representation Information so its digital forms can be understood over the Long Term.
Aangezien RI zo cruciaal is voor alle digitale archivering, ligt het voor de hand dat er al allerlei "registers" zijn waar deze informatie in beschreven wordt: PRONOM, GDFR en wat niet al.
Al die registers hebben volgens Andrew N. Jackson, Maureen Pennock en Paul Wheatley een of meer van de volgende tekortkomingen

Crowdsourcing Representation Information to Support Preservation: CRISP from mopennock

Hun oplossing is eigenlijk hartstikke simpel, daarom sympathiek en misschien wel geniaal:
cRIsp - Crowd sourced Representation Information for Supporting Preservation
cRIsp is aiming to combat these challenges by drawing upon the wisdom and knowledge of the crowd to identify online sources of RI, and then collect, classify, and preserve them. We've aimed to set the barrier for participation as low as possible. Anyone can easily contribute URLs via a really simple web form, or by tweeting and including @dpref. The collated results will then be passed to participating web archives who can crawl the sites and preserve them for posterity.
Het idee is dat iedereen die op het web relevante informatie vindt, deze aan cRIsp kan toevoegen. Dat kan door een tweet te sturen naar @dpref:
Maar je kunt ook een bookmarklet gebruiken of een simpel Google-form.
Het resultaat is voorlopig een Google-sheet waarin alle links verzameld wordt, daarna zullen alle relevante webpagina's bewaard worden.
En daarna?
The resulting collection of RI will hopefully be a useful resource in its own right, but will represent only the first step on the road to powerful RI and file format registries. cRIsp is all about finding the RI and making it safe. The results of cRIsp can then feed into other initiatives such as theLoC's Sustainability of Digital Formats site, Just Solve the Format Problem and the UDFR. In this way, we hope that cRIsp will be quite complimentary to these other approaches.
 Ik vind het in ieder geval prachtig in zijn eenvoud...

Gerelateerd
November is bestandsformatenmaand
Costa Concordia en webarchivering
Filmpje over website-archivering en IIPC

woensdag 30 mei 2012

Publitiek - De Tweede Kamer toegankelijk

Naar aanleiding van mijn tweet over het Archieven-mogen-niet-met-Mormonen samenwerken-debat dat het CDA heeft aangevraagd, attendeerde iemand me op publitiek.nl. Want daar stond in de regeling van werkzaamheden van 22 mei zwart op wit dat het debat gepland zou worden:
Ger Koopmans (CDA)
Voorzitter. Wij willen graag een debat aanvragen met de staatssecretaris van OCW en de minister van BZK over het digitaliseren van archieven door mormonen. Mevrouw Hazekamp van de Partij voor de Dieren heeft hierover ook al vragen gesteld. De antwoorden die wij daarop kregen, bevallen ons totaal niet. Wij vinden die veel te afwachtend en te afhoudend. Daarom zouden wij daarover graag een debat willen voeren met beide bewindslieden. Permalink
Dit had ik op de site van de Tweede Kamer nog niet terug gevonden. En nee, ik ga hier niets zeggen over de kwaliteit van de bijdragen van de gewaardeerde kamerleden...

Publitiek bestaat sinds 2009 en is een idee van Wolq, dat ondertussen wordt gesponsord door XS4All:
Deze website begon in 2009 als inzending voor een wedstrijd van het ministerie van Binnenlandse Zaken. Met ons concept wilden wij overheidsinformatie toegankelijker maken, op een gebruiksvriendelijke manier. Wij hebben deze wedstrijd helaas niet gewonnen. Maar vanwege de vele enthousiaste reacties hebben wij besloten om ons concept verder uit te werken tot een volledig functionerende website.
De inhoud van de site bestaat uit "nieuwsberichten van nationale en internationale media, berichten die politici plaatsen op hun officiële Twitter pagina's, artikelen van weblogs van politici, en de websites van de Tweede Kamer en het Kabinet." Daarnaast gebruiken ze de verslagen van de Tweede Kamer als basis voor de weergave van debatten en stemmingen, die vervolgens voorzien worden van een meer gebruiksvriendelijke vormgeving.

Je kunt op de site volledige debatten nalezen en ze heel eenvoudig door zoeken. Zo ontdekte ik net dat de minister-president tijdens het debat van afgelopen donderdag nog iets over het Nationaal Archief, brieven en e-mail zei:
Het is geen kwestie van modernisering. We moeten ons aanpassen aan het feit dat er een ander type maatschappelijk verkeer is ontstaan en dat de techniek is voortgeschreden. Neem het feit dat politici elkaar brieven schreven. Kijkt u daar in ons prachtige Nationaal Archief eens naar. Ik heb als historicus onderzoek gedaan en gezien dat iemand als Oud, de leider van de VVD in de jaren vijftig, per dag misschien wel tien brieven schreef en misschien ook weer tien brieven terugkreeg. Die tijd is voorbij! We zitten in een heel andere tijd. De heer Roemer moet zich realiseren dat wij in een andere tijd zitten. We hebben tegenwoordig e-mail, ook bij de SP, neem ik aan. Ik zie alle moderne apparatuur liggen. We doen het anders. Dat betekent dat de hele postmarkt is veranderd. Daar moeten we ons op aanpassen. Dat is niet omdat we willen moderniseren om te moderniseren, maar omdat je geen musea in stand kunt houden, hoe goed ze ook gefunctioneerd hebben, hoe hoog de waardering ook was voor de kwaliteit van het werk. We leven in een ander type samenleving wat betreft het berichtenverkeer.
Mooi hoor...
Ben wel benieuwd of iemand deze website ook bewaard voor later...

Gerelateerd
Postuum dopen en de archieven
Persoonlijke levenssfeer van overledenen
Over het maken van soja-saus en het bewaren van websites

donderdag 19 januari 2012

Costa Concordia en webarchivering

Het lijkt een rare relatie, de schipbreuk van de Costa Concordia en webarchivering, maar toch...
Na een tweet van Marieke Guy las ik een artikel van Kate Hodges in The Guardian. Hodges beschrijft daarin hoe ze in 1988 als vijftienjarige tijdens een schoolreis de schipbreuk van de Jupiter in de haven van Piraeus overleefde. Ze beschrijft hoe ze van het schip gleed en naar een reddingsboot zwom. Hoe de pers meteen aan de kade stond met camera's en vragen en dat ze kort met haar ouders kon bellen. En dan schrijft ze:
I didn't know what to say or where to start, and just ended up insisting that they record all the news coverage. I wanted to absorb as much information about the incident as I could. I needed context, perspective, and to appreciate how it was being covered in the UK. Unlike us, the survivors of the Costa Concordia will have the benefit of archived online coverage. I'm sure that they will plough through it, scouring for details to help them define their part in the story and make sense of the event.
In die zin is het archiveren of collectioneren van websites dus meer dan "cultureel erfgoed bewaren." Het kan betrokkenen helpen bij het betekenis geven en verwerken van een dergelijke ingrijpende gebeurtenis.
Dit is ook wat The Internet Archive deed met de 9/11-nieuwsuitzendingen. En als de KB zijn web-acquisitie meer richt op dit soort ingrijpende gebeurtenissen, dan is de kans op huilende bezoekers in de (digitale) leeszaal natuurlijk ook groter.

Gerelateerd
Over het maken van soja-saus en het bewaren van websites
Websites archiveren of websites verzamelen

woensdag 23 november 2011

Wayback in de rechtszaal

Ik zou natuurlijk moeten schrijven over de voorgestelde wijziging van de Archiefwet, maar dat komt misschien later deze week nog wel een keer. Vandaag nog eens iets over webarchieven en rechtszaken.
In The Lawyers Weekly (wie leest hem niet...) staat deze week een artikeltje over het gebruik van de Wayback Machine in Amerikaanse en Canadese rechtszaken:
A notorious criminal trial in Toronto in 2005 saw the application of such evidence, to the annoyance of the trial judge and the embarrassment of counsel. The Crown was prosecuting three teenagers for the particularly gruesome murder of a 12-year-old boy. After a three-month trial, the case was remitted to the jury. While they were still deliberating, an enterprising newspaper reporter using the Wayback Machine discovered online postings that had been made but deleted by a key prosecution witness. The postings suggested she had perjured herself. When the judge read about this in the next day’s newspaper, the prospect of perjury compelled him to declare a mistrial.

Counsel then had to explain how they had failed to uncover such critical evidence despite months of trial preparation, particularly when a newspaper reporter had found it so easily. The judge was not impressed by their pleas that they were mere lawyers unfamiliar with Internet archives.
In het artikeltje wordt ook nog even in gegaan op de manier waarop webpagina's aan de rechter voorgelegd moeten worden. Blijkbaar gebeurt dit (in Canada) nog altijd op papier, want
Opposing counsel may agree to their admissibility and allow printouts to be included in an agreed exhibit book. If that is not possible, satisfying the trial judge will likely require evidence from someone explaining the nature of the Wayback Machine, its use and certifying the results.
If an affidavit from the client is deemed insufficient, the Internet Archive will, for a nominal fee, provide a sworn statement (www.archive.org/legal/affidavit.php) authenticating pages or other information from the Wayback Machine. Requests and payment can be submitted online or by regular mail.
Even aan Arnoud gevraagd of hier ook Nederlandse voorbeelden van zijn en prompt verwees hij me naar deze zaak, waarin iemand inderdaad verwijst naar de Wayback Machine. Onder 4.14 staat:
Dit zou onder meer blijken uit de door hen overgelegde uitdraai van het internetarchief ‘Wayback Machine’, een internetarchief dat het mogelijk maakt om oude versies van websites op te zoeken (...)
De rechter gaat verder niet in op de toelaatbaarheid van dit bewijs, maar er lijken geen redenen te zijn waarom dit bewijs door een rechter niet geaccepteerd zou worden.

Gerelateerd
Valse documenten in een rechtszaak

dinsdag 4 oktober 2011

Filmpje over website-archivering & IIPC


Web Archiving and the IIPC - English from Abbey Potter on Vimeo.

Mooi filmpje met onder andere René Voorburg van de KB.

Zie verder de website van het IIPC: netpreserve.org
MissionThe mission of the International Internet Preservation Consortium (IIPC) is to acquire, preserve and make accessible knowledge and information from the Internet for future generations everywhere, promoting global exchange and international relations.
GoalsTo achieve its mission, the IIPC is working to accomplish the following goals:
  • To enable the collection of a rich body of Internet content from around the world to be preserved in a way that it can be archived, secured and accessed over time.
  • To foster the development and use of common tools, techniques and standards that enable the creation of international archives.
  • To encourage and support national libraries everywhere to address Internet archiving and preservation.

woensdag 28 september 2011

Deleted City is digitale archeologie


Met het risico weer in een discussie met Chido terecht te komen over de vraag of dit "archiveren" is of niet: bovenstaand filmpje is weer van Archive Team. Je ziet een interactieve visualisatie van de 650 Gigabyte "back-up" die Archive Team in 2009 maakte van Geocities, vlak voordat Yahoo de stekker er uit trok.
It depicts the file system as a city map, spatially arranging the different neighbourhoods and individual lots based on the number of files they contain.
In full view, the map is a datavisualisation showing the relative sizes of the different neighbourhoods. While zooming in, more and more detail becomes visible, eventually showing invididual html pages and the images they contain. While browsing, nearby MIDI files are played.
Mocht je zelf een kopie van Geocities willen installeren, via The Pirate Bay kun je de volledige torrent-file downloaden.

Gerelateerd
Over het maken van sojasaus en het bewaren van websites
Delicious stopte (of bijna dan toch)

woensdag 7 september 2011

Over het maken van soja-saus en het bewaren van websites



For the last few years, historian and archivist Jason Scott has been involved with a loose, rogue band of data preservation activists called The Archive Team. As major sites with brand recognition and the work of millions announce short-notice shutdowns of their entire services, including Geocities, Friendster, and Yahoo Video, Archive Team arrives on the scene to duplicate as much as they possibly can for history before all the data is wiped forever. To do this, they have been rude, crude and far outside the spectrum of polite requests to save digital history, and have used a variety of techniques to retrieve and extract data that might have otherwise been unreachable. Come for the rough-and-tumble extraction techniques and teamwork methods, stay for the humor and ranting.
Als je drie kwartier over hebt, is dit erg onderhoudend: humoristisch, gevoelig en to the point. Vergelijkbaar met een van de eerste speel-en-deel-sessies, maar dan anders...

Beste zin uit de presentatie:


Google is an archive or a library, lik a supermarket is a food museum


Gerelateerd
Ook een vorm van website archivering
Websites archiveren of websites verzamelen
Delicious stopte (of bijna dan toch)

vrijdag 26 augustus 2011

Meerssen in het UK Webarchive

Met een N-gram-viewer kun je de frequentie van woorden en zinsnedes in een corpus onderzoeken en visualiseren. Ik schreef begin dit jaar al over de N-gram-viewer van Google.
Sinds een paar dagen kun je in het UK Webarchive van de British Library ook zoeken via een N-gram-viewer. In de grafiek hierboven zie je hoe vaak "Meerssen" voorkomt in het Engelse webarchief. Vaker dan ik dacht, eigenlijk.
Het mooie is ook (en dat ontbrak volgens mij bij de GoogleBooks-versie) dat je kunt klikken op de waardes en dan meteen een overzicht krijgt van de relevante pagina's. Dit zijn de pagina's uit oktober 2010 waar Meerssen in voorkomt. (En door het UK Webarchive weet ik nu dus dat Meerssen een "zustergemeente" is van Sherborne.)
Verder werd Meerssen genoemd in een rapport van de Conservatieven over afvalverzameling. (Omdat wij hier verplicht zijn om gemeentelijke roze vuilniszakken te gebruiken in plaats van de standaard grijze zakken...)
En nog een ego-mededeling, ik word ook genoemd!

Hoe dan ook, dit zijn mooie dingen voor taal- en cultuuronderzoekers.
Het wordt toch tijd dat de KB zijn collectie websites gewoon open kan gooien, zodat dit soort dingen ook met het Nederlandse web mogelijk worden.

Gerelateerd
Cultuurgeschiedenis en taalontwikkeling
Websites archiveren of websites verzamelen?

zaterdag 6 augustus 2011

Ook een vorm van website-archivering


Philip Mendoça-Vieira heeft tussen september 2010 en juli 2011 per ongeluk zo'n 12.000 screenshots gemaakt van de homepage van nytimes.com en daar bovenstaand filmpje van gemaakt.
Having worked with and developed on a number of content management systems I can tell you that as a rule of thumb no one is storing their frontpage layout data. It's all gone, and once newspapers shutter their physical distribution operations I get this feeling that we're no longer going to have a comprehensive archive of how our news-sources of note looked on a daily basis. Archive.org comes close, but there are too many gaps to my liking.

This, in my humble opinion, is a tragedy because in many ways our frontpages are summaries of our perspectives and our preconceptions. They store what we thought was important, in a way that is easy and quick to parse and extremely valuable for any future generations wishing to study our time period.
Via Long Now-blog

Gerelateerd
Het archief van de krant
Websites archiveren of websites verzamelen

zaterdag 21 mei 2011

BlogForever

Geen idee meer hoe ik hier terecht ben gekomen, maar het is wel een interessante website van een interessant project: BlogForever. Uit de missie van het EU-project:
BLOGFOREVER will develop robust digital preservation, management and dissemination facilities for weblogs. These facilities will be able to capture the dynamic and continuously evolving nature of weblogs, their network and social structure, and the exchange of concepts and ideas that they foster; pieces of information omitted by current Web Archiving methods and solutions.
[...]
The final output of BLOGFOREVER will be a simple weblog digital archiving solution that any user, user group or institution could use to preserve their weblog(s) and ensure their authenticity, integrity, completeness, usability, and long term accessibility as a valuable cultural, social, and intellectual resource. A multitude of parties will benefit from the project, including libraries and information centres, museums, universities, research institutes, businesses, and bloggers.
Ik ben vooral benieuwd naar de "simpele" oplossing die iedereen kan gebruiken.

Gerelateerd
Het archiveren van weblogs
Het bewaren van overheidswebsites
Archiveren 2.0 tijdens de KVAN-dagen

dinsdag 19 april 2011

Websites archiveren of websites verzamelen?

Het was een gemêleerd gezelschap dat gistermiddag op uitnodiging van Inge Angevaare in een zaaltje van de KB zat om te praten over "webarchivering."
Twee medewerkers van Atos Origin, waaronder Marleen, twee gemeentelijke archiefinspecteurs, waaronder Jacco, iemand van een gemeenschappelijke regeling die een marktonderzoek naar webarchivering had gedaan, twee mensen die over de selectie en controle van het Webarchief van de KB gaan, iemand van de KB die over de procesinrichting gaat, vier mensen van het Nationaal Archief, (eindelijk Maurice ontmoet) , Bernadine van CODA, vier mensen van Tresoar, iemand van het AWN, drie medewerkers van het UWV, twee mannen van Beeld en Geluid, iemand van Pictura, iemand van Archiefweb en nog een 'verkoper' die niet gezegd heeft waar hij voor werkt, een meneer van Archipol, Bente van de gemeente Bergen op Zoom, Vincent van GAR, Petra van NIOD, Robert van DEN, Erika van zichzelf, een stagiaire van UB Leiden, iemand van het Westfries Archief en iemand van de provinciale archiefinspectie Noord-Brabant en Limburg.
En desondanks, of misschien wel dankzij deze variëteit zijn er wel een paar dingen helder geworden.

1. Er is een verschil tussen een website archiveren vanuit de verantwoordingsfunctie (zoals iedere overheidsorganisatie zou moeten doen) en het verzamelen van websites vanwege cultureel belang (zoals de KB doet). De technieken kunnen misschien hetzelfde zijn, maar de uitgangspunten, frequentie van 'oogsten' en eventueel bewaartermijnen zijn anders. Zo anders dat het misschien wel twee verschillende "problemen" zijn.

2. Alles wat je doet, is beter dan niets. Dit werd het mooiste geïllustreerd door de mensen van het UWV. Omdat burgers rechten kunnen ontlenen van de teksten en toelichtingen die het UWV op zijn website publiceert, wordt iedere wijziging gedocumenteerd. En dat kunnen meerdere wijzigingen per dag zijn. Bij gebrek aan beter maakt het UWV nu iedere keer een screenshot van de pagina, plakt die in Word en maakt er een beschrijving van. Dit is uiteraard niet ideaal, want allerlei functionaliteiten van de website gaan verloren, maar ze hebben wel de 'oude' inhoud vastgelegd. En het mooie is, vanaf nu kan het alleen maar beter gaan! Want doordat het een houtje-touwtje oplossing is, zijn ze gedwongen een betere oplossing te verzinnen. En iedere (geautomatiseerde) opslag van een 'echte' HTML-pagina zal een vooruitgang zijn.

3. Het gebruik van de Webrichtlijnen voor overheidswebsites leidt niet alleen tot beter toegankelijke sites, maar ook tot eenvoudiger te 'oogsten' websites. Ook als het om heel grote sites, zoals bijvoorbeeld rijksoverheid.nl, gaat.

4. Er is geen overzicht van welke instelling welke websites verzameld. De KB heeft nu een selectie van 3.000 sites en wil er in 2013 ongeveer 10.000 hebben, Beeld en Geluid doet wat, Archipol doet iets, sommige archiefdiensten oogsten lokale websites, maar het zou heel mooi zijn als er een overzicht was van:
a. welke sites zijn al geselecteerd
b. wat zijn de selectiecriteria van de verschillende diensten, zodat je kunt achterhalen bij wie je een "vergeten" website zou kunnen aanmelden.

Tenslotte nog één losse flodder en één trivialiteit, (in willekeurige volgorde):
Iemand opperde dat "we" een pamflet moesten opstellen waarin we beschreven wat "het" probleem was en dat "we" vonden dat "we" het moesten oplossen. En dan zou "het" natuurlijk ook allemaal opgelost worden. Het bleef een beetje onduidelijk wie "we" was, aan wie dat pamflet gericht zou worden en wat "het" was dat opgelost ging worden.
Hoe zeiden ze dat in Amsterdam ook al weer: is dit beleid of is hierover nagedacht?

En het Openluchtmuseum in Arnhem is waarschijnlijk de enige instantie met een zo goed als complete collectie Wehkamp-catalogi! Ze hebben die verzameld om oude interieurs uit ieder decennium zo precies mogelijk na te kunnen bouwen. Dat is toch mooi...
(En dit kwam ter sprake, omdat men zich in Arnhem afvroeg hoe dat nou moest als de Wehkamp-collectie enkel nog digitaal via de website te bekijken is).

En dit was enkel het "officiële" programma, in de wandelgangen werden ook heel wat interessante dingen besproken en uitgewisseld.

Gerelateerd
Ik heb een webpagina gezien
Websites archiveer je voor een zesbenig wezen
Het bewaren van overheidswebsites
Lulu en het archiveren van websites
Strategische agenda van de NCDD

Plaatje: How to capture a webpage and keep Hyperlinks van Ivan Walsh

zaterdag 16 april 2011

DDS tien jaar offline


In 2011 is het 10 jaar geleden dat het internet pioniersproject en de oudste virtuele gemeenschap in Nederland, De Digitale Stad (DDS), uit het publieke domein verdween. Internet bestaat inmiddels 42 jaar en het world wide web 21 jaar. Daarom is het hoog tijd voor de reconstructie van de DDS, om dit unieke digitale historische monument de plek te geven die het verdient, binnen de geschiedenis van Amsterdam, en om de digitale archeologische resten veilig te stellen voor de toekomst in de depots van de verschillende erfgoedinstellingen van de stad.

Het project re:DDS is geboren uit de wens van het Amsterdam Museum (voorheen Amsterdams Historisch Museum), de Waag Society, DDS Holding BV en DDS webarcheologen van het eerste uur om de DDS te behouden voor Amsterdam, en deze op te nemen in de collectie/presentatie van het Amsterdam Museum. Met de start van de DDS op 15 januari 1994 in Amsterdam werd in Nederland voor het eerst het internet toegankelijk voor het grote publiek. DDS is kenmerkend voor het verhaal van Amsterdam en de hedendaagse geschiedenis.
Volgens mij heb ik ook nog eens een dds.nl-emailadres gehad...

Lees en bekijk meer op Re:DDS.

woensdag 23 maart 2011

Ik heb een webpagina gezien

Wi deken ende capittel van sinte g(eertrui)denberghe doen condt allen luden dat wij ghesien ende ghelesen hebben enen brief goet gans ende gave ongheraseert onghecancelleert wel bezeghelt sprekende van woerde te woerde ghelijc hier na bescreven staet

Via een reactie op BREED kwam ik gisteren op de website van Bewijsonline:
Door de toename van het internetgebruik nemen de juridische zaken die hieraan zijn gerelateerd navenant toe. Zo kan er sprake zijn van inbreuk op auteursrecht, merkenrecht of een handelsnaam. Ook kan er bewijs geleverd moten worden in verband met het verbeuren van dwangsommen. Bijvoorbeeld in het geval dat de wederpartij iets online heeft gezet dat eerder verboden is door de (voorzieningen)rechter.

In al deze gevallen komt de eisende partij voor het probleem te staan dat allereerst bewezen moet worden dat de gewraakte uiting ook daadwerkelijk online heeft gestaan op een bepaald moment.

Dit bewijzen is lastig omdat een afdruk van een screenshot niet zonder meer als onomstotelijk bewijs kan gelden en een gedaagde in luttele seconden de content van zijn website kan verwijderen of wijzigen. Maar hoe kan dit dan worden bewezen? Bewijsonline.nl biedt hiervoor de ideale oplossing! Bewijsonline.nl heeft een systeem ontwikkeld om hierin te voorzien tegen zo gering mogelijke kosten. Bewijsonline.nl genereert direct een door een deurwaarder gewaarmerkt proces-verbaal van constatering en u ontvangt deze als pdf in de vorm van een kant-en-klare productie die u zo bij uw dagvaarding of ander processtuk kunt voegen!
Onder Hoe werkt het wordt beschreven dat  je als gebruiker een account aanmaakt, op een knop klikt en de url's van de webpagina's die je in de vidimus (dank je @FBit) opgenomen wil hebben knipt-en-plakt. Het systeem genereert een pdf en daarna controleert de bij Bewijsonline aangesloten gerechtsdeurwaarder of deze pagina’s inderdaad op het internet gepubliceerd zijn (geweest). En binnen twee dagen later krijg je een pdf toegestuurd. Hier een voorbeeldje (pdf) daarvan.

Nou zit hier toch een probleempje volgens mij.
Ik bedoel, in bovenstaande citaat geeft Bewijsonline zelf aan dat "in luttele seconden de content van [een] website" verwijderd of gewijzigd kan worden. Maar stel nu dat ik om half drie 's nachts op die knop duw, wordt die deurwaarder dan ook opgepiept om binnen een paar seconden naar die webpagina's te gaan kijken? Ik zie nergens staan dat de service beperkt is tot de kantooruren...
Ik zou het bijna uitproberen, maar €175,- en €2,50 per pagina (exclusief BTW) is met toch wat te duur voor een testje...
Het lijkt me sowieso de vraag hoe groot de markt voor deze diensten nu eigenlijk is. Wij roepen wel overal dat overheidswebsites goed bewaard moeten worden, omdat burgers je kunnen aanspreken op wat je gepubliceerd hebt, maar ik heb tot nu toe bij de provincie pas één voorbeeld gezien waarbij het echt 'menens' was. Het moet al om echt grote bedragen gaan voor ik als 'belanghebbende' €175 uit ga geven, terwijl een 'gewone' print misschien ook al goed genoeg is.

Of zie ik een gat in de markt (dat volgens librarianbe bijvoorbeeld ook door archiefdiensten of bibliotheken ingevuld zou kunnen worden) over het hoofd?

Het citaat hierboven komt via de Charterbank van het Regionaal Archief Tilburg uit een akte uit 1498 uit de charterverzameling Geertruidenberg


Gerelateerd

woensdag 2 maart 2011

Websites archiveer je voor een zesbenig wezen

The really big thing about this project is that …when you archive a website, it’s being preserved forever. You’re writing history. Someday in the future when we're all gone,
…some 6-legged creature could come to earth, go to LC and discover what people were like 3,000 years ago.
Wat een geweldig project van Library of Congres en Archive-It:


En wat zeggen die tieners slimme dingen!

Wanneer gaan de KB en de NCDD dit soort projecten op scholen doen?

Gerelateerd
Digitale autochtonen over digitale duurzaamheid (ED3-blog)
Het archiveren van weblogs

woensdag 23 februari 2011

Het bewaren van overheidswebsites

De startpagina van de eerste website van Brabant. Deze is alleen bewaard door Archive.org
Archiefbescheiden: bescheiden, ongeacht hun vorm, door de overheidsorganen ontvangen of opgemaakt en naar hun aard bestemd daaronder te berusten
In 2000 begon het Documentatiecentrum Nederlandse Politieke Partijen (DNPP) in samenwerking met de Universiteitsbibliotheek Groningen onder naam Archipol met het archiveren van de websites van de Nederlandse politieke partijen. (...)
Het DNPP beschouwt het bewaren van de websites van de partijen als een logisch vervolg van zijn traditionele taak, namelijk het documenteren van gedrukte publicaties van en over partijen. Het digitaal archief vormt een bron van informatie voor onderzoekers van velerlei disciplines (zoals historici en politicologen) en journalisten.
De ontwikkelfase van het Archipol-project werd op 25 april 2002 afgesloten met een symposium over webarchivering, politieke partijen op het internet en de auteursrechtelijke aspecten van het downloaden van websites.
Websites worden tenslotte ook gearchiveerd omdat ze archiefbescheiden zijn, archiefbescheiden bevatten of omdat er door middel van een website archiefbescheiden worden gecreëerd. De huidige generatie websites hebben meer functionaliteiten dan de traditionele informatiekanalen. Websites spelen een steeds grotere rol in het werkproces. Ze worden niet louter meer als publicatie gebruikt, maar worden volop ingeschakeld in het dienstverlenings- en bedrijfsvoeringsproces. De huidige tendens naar e-government en e-commerce illustreert dit. Transacties of handelingen die verantwoording vereisen, worden steeds meer via Internet- en intranetsites uitgevoerd.
Een organisatie die websites gebruikt bij de uitvoering van haar taken zal in of via die website archief creëren. In de Archiefwet 1995 art. 3 is bepaald dat de overheid haar archieven in goede, geordende en toegankelijke staat dient te brengen en bewaren.
Is een website archief - procesgebonden informatie?
Moet een organisatie de website ook in het archiveringssysteem opnemen?
Hoe zorgt een organisatie voor een goede archivering van haar website?
Dit handboek vormt het tastbare product van de werkgroep. Het is enerzijds een handleiding-inopbouw voor het archiveren van websites en anderzijds een verslag van de activiteiten van het
deelproject. In dit verslag worden de bevindingen weergegeven, de keuzes verantwoord, en
aanbevelingen gegeven.
Met het uitbreiden van de functies van websites groeide geleidelijk aan ook binnen de archieven het inzicht dat websites en webgebaseerde documenten de status van archiefdocument kunnen hebben en dus voor lange termijnarchivering in aanmerking kunnen komen. Terwijl de bibliotheekwereld streeft naar het vastleggen van zoveel mogelijk webmateriaal en volledige websites die binnen het acquisitieprofiel passen, ligt voor de archiefwereld de klemtoon op het archiveren van de (delen van) websites en webgebaseerde documenten met archiefstatus. Dit veronderstelt dat de archiefdocumenten eerst worden geïdentificeerd en gewaardeerd. Archieven richten zich hierbij niet alleen op de Internet websites, maar ook op de intranetsites, het zogenaamde “deep web” en de neerslag van transacties en handelingen die via websites tot stand komen.
Deze bibliografie bevat verwijzingen naar publicaties over het archiveren van websites. Deze
literatuurstudie is uitgevoerd tijdens de twee onderzoeken die de Archiefschool de afgelopen jaren heeft uitgevoerd naar de archivering van websites.
In de praktijk dient een website vaak meerdere doelen en heeft de informatie een relatie met verschillende processen van een organisatie, zowel voorlichting, communicatie, dienstverlening of welk ander proces ook. Daarmee wordt de website een bundeling (verzameling) van archiefbescheiden gerelateerd aan verschillende bedrijfsprocessen.
Websites zijn overal en nergens. Ze zijn dynamisch, multimediaal en interactief. Allerhande bedrijven, organisaties en particulieren hebben een eigen stek op het web, ook culturele instellingen en kunstenaars. In het Unesco ‘Charter on the Preservation of the Digital Heritage’(2003) worden websites expliciet tot ons digitaal erfgoed gerekend.
Voor het archiveren van websites zijn er een aantal nuttige tools. In dit overzicht geven we een beknopte beschrijving van verschillende methodes en tools met telkens verwijzingen naar de bijhorende documentatie.
Bovenstaande stellingen scheppen voor (lokale) overheden de verplichting om na te denken over webarchivering en hiervoor procedures op te stellen en daarnaast een omgeving te creëren waarin het mogelijk is om websites (c.q. web records) daadwerkelijk te archiveren, wat meer is dan documenteren. Archivering bestaat uit acht verschillende processen:
capture/opnemen, opslaan/registreren, ordenen, beschrijven, waarderen/selecteren, verwijderen, bewaren en beschikbaar stellen. Deze processen zullen onderdeel moeten uitmaken van de archiveringsstrategie
En, jongens, dat is alleen nog maar de Nederlandstalige literatuur, die ik in een uurtje bij elkaar geklikt heb!
Dus als de lokale overheden nu eindelijk ook eens gaan nadenken over hun website, maar dan zonder blikken of blozen stellen dat "de archiefdienst" hier voor verantwoordelijk is, of dat de enige oplossing het inschakelen van een commerciële aanbieder is, dan vind ik dat geen toonbeeld van deskundigheid (om niet te spreken van daadkracht en doortastendheid).

Gerelateerd
Openbaarheid in Vlaanderen - aanvullingen en correcties
Het archief van de krant
Het archiveren van weblogs
Lulu en het archiveren van websites

woensdag 16 februari 2011

Openbaarheid in Vlaanderen - aanvullingen en correcties

Eerder vandaag schreef ik over Openbaarheid in Vlaanderen. Hierbij verwees ik naar de manier waarop de gearchiveerde websites bij het Felixarchief toegankelijk zijn. Meteen nadat ik de blog gepubliceerd had, reageerde een medewerker van het archief via Twitter. Naar aanleiding daarvan een paar aanvullingen en correcties.

1. In de praktijk gaat het Felixarchief redelijk "pragmatisch" om met de identificatieplicht. Als je ver weg woont (zoals ik) is het niet per sé noodzakelijk dat je je gezicht in de leeszaal laat zien om geverifieerd te worden. Ik werd onder andere gewezen op deze passage op de website:
Schrijf u vandaag nog in als bezoeker, laat u verifieren via het telefoonnummer 03 338 94 11 en raadpleeg onze archieven van thuis uit! 
2. Ik schreef ook dat er nog een tweede addertje was: mijn mailbox zou niet groot genoeg zijn om de DIP te ontvangen. Tot mijn schande bleek dat ik geen email kreeg, omdat ik geen mailadres had opgegeven! Oei, oei, oei...Ik heb me een half uurtje in een hoekje staan schamen...
Nadat ik mijn mailadres had ingevuld en een nieuwe poging had gedaan, bleek dat je een link naar het zip-bestand gemaild krijgt. Ik heb het bestand gedownload en heb nu dus een vijftien jaar oude website volledig op mijn laptop staan. Hierboven de mooie, toen heel moderne, startpagina en hieronder de archiefbeschrijving.
Dat maakt trouwens ook meteen duidelijk dat deze en deze discussie op BREED grotendeels gebaseerd zijn op ondeskundigheid (om niet van luiheid of laksheid te spreken...)

Terwijl ik toch bezig was, wilde ik dit archiefexemplaar van de site ook even vergelijken met het exemplaar in de Wayback Machine. Helaas bleek dat niet mogelijk, omdat Antwerpen de toegang voor robots heeft uitgeschakeld.

Hoe dan ook, met dank aan FB: I stand corrected.

Gerelateerd
Openbaarheid in Vlaanderen

Openbaarheid in Vlaanderen

Een paar weken geleden verwees Eric op het Archiefforum naar de gearchiveerde websites van de stad Antwerpen. Toen ik de archiefexemplaren wilde raadplegen bleek er een addertje onder het gras te zitten.
Op grond van artikel 17 het Vlaamse openbaarheidsdecreet moet de aanvrager van overheidsinformatie zijn aanvraag schriftelijk indienen en moet hij zijn identiteit bewijzen. Het addertje is nu dat overgebrachte archieven hier blijkbaar ook onder vallen. Dat betekent bijvoorbeeld dat je de archief-exemplaren van de (voorheen) openbare website van de stad Antwerpen pas van huis uit kunt raadplegen als je:
  1. een account bij het Felixarchief hebt aangemaakt en
  2. in Antwerpen aan de balie bent geweest en hebt bewezen dat jij bij die account hoort! 
Dat is nog al een verschil met Nederland, waar je je noch voor een WOB-verzoek, noch voor inzage van overgebrachte archieven op grond van de Archiefwet hoeft te identificeren.
(Dat archiefdiensten hier toch om vragen, is meer vanuit een controle-aspect: ze willen bij eventuele vermissing of beschadiging kunnen achterhalen wie een archiefstuk voor het laatst heeft geraadpleegd.)

Overigens: mijn gebruikersaccount is ondertussen gevalideerd, maar ik heb de websites nog altijd niet kunnen bekijken. Als je ze wil inzien, e-mailt het Felix-archief een ZIP-bestand (DIP in OAIS-termen) met alle bestanden. Het tweede addertje is nu dat de kleinste, gearchiveerde site circa 35 MB is en geen van mijn mailboxen dergelijke omvangrijke bestanden accepteren...

Aanvulling op woensdag 16 februari 2011 om 20:46 uur
In bovenstaand bericht bleken nog al wat slordigheden en fouten te staan. Lees daarom vooral ook Openbaarheid in Vlaanderen - aanvullingen en correcties

Gerelateerd
Optimaal Digitaal
Muziek in het Archief - voorheen een archiefding
Isn’t our American democracy amazing?
Het archiveren van weblogs
Lulu en het archiveren van websites

Plaatje: freedom of movemento, freedom of information van Cau Napoli