Posts tonen met het label Internet Archive. Alle posts tonen
Posts tonen met het label Internet Archive. Alle posts tonen

zaterdag 14 december 2013

TV-nieuws op de kaart

Understanding 9/11, het audio-visueel archief van The Internet Archive over 11 september, kende ik al. Maar het TV news Archive, waar je door het Amerikaanse TV-nieuws kunt zoeken, dat Jason Scott tijdens DISH13 liet zien kende ik niet: 
the Internet Archive collects and preserves television news.  Like library collections of books and newspapers, this accessible archive of TV news enables anyone to reference and compare statements from this influential medium.
The collection now contains 506,000 news programs collected over 4 years from national U.S. networks and stations in San Francisco and Washington D.C.  The archive is updated with new broadcasts 24 hours after they are aired.  Older materials are also being added.
Use the index of searchable text and short, streamed clips to find programs to borrow on DVD-ROM or view at the Internet Archive’s library in San Francisco.
(Die laatste constructie - enkel clips online en DVD's lenen of in San Francisco kijken - is natuurlijk de bibliotheek-oplossing voor de auteursrechten-problematiek.)
Het interessante van het TV News Archive is dat je het op trefwoord kunt door zoeken en dan op een tijdlijn alle resultaten krijgt. Zo kun je kijken hoe de Amerikaanse media berichten over het overlijden van Nelson Mandela vorige week. En hier zie je alle Amerikaanse nieuwsuitzendingen over Geert Wilders.
Het wereldkaartje helemaal bovenaan dit blog is ook heel fascinerend.
Kalev Leetaru heeft de 400.000 uur aan nieuwsopnamen "gegeocodeerd" door alle in de uitzendingen genoemde plaatsnamen op de kaart te plotten. Het gifje hierboven is maar een uitsnede, op TvGeo kun je inzoomen op de kaart, en zoeken op plaatsen. En ja er zitten fouten in, want dit gaat wel over Margraten, maar al deze uitzendingen gaan natuurlijk echt niet over de Heek in Klimmen. Maar zoals op het blog van The Internet Archive staat:
 Keep in mind that as you explore, zoom-in and click the locations in these pilot maps, you are going to find a lot of errors. What you see here represents our very first experiment with revealing the geography of television news and required bringing together a bunch of cutting-edge technologies that are still very much active areas of research. While there is still lots of work to be done, we think this represents a tremendously exciting prototype for new ways of interacting with the world’s information by organizing it geographically and putting it on a map where it belongs!
En het is inderdaad tremendously exciting.

Gerelateerd
Hyves, Retronaut en 3D-objecten #dish13
Mooiste TV (uit Duitsland en België)
De digitale archieven van de BBC

vrijdag 22 november 2013

The Wayback Machine bewijst het


Ik denk dat iedereen ondertussen wel gehoord heeft dat Arrold tijdens een televisiespelletje 4.875.000 euro is misgelopen door een druk op een rode knop. Hij heeft Peter Plasman in de arm genomen om alsnog van de Postcodeloterij / Endemol een koffertje met 5.000.000 euro te krijgen.
Plasman heeft speciaal voor dit geval een website heeft opgericht: http://rechtopmiljoenen.com.s3-website-eu-west-1.amazonaws.com/ Daar staan interessante dingen op.
Het dispuut spitst zich toe op de rol van de rode knop: is het spel afgelopen als daar op geduwd wordt? In de huidige spelregels staat expliciet dat het bod aanvaard wordt, door op de rode knop te duwen. Maar stond dat ook in de spelregels die golden ten tijde van de opnamen?
Plasman maakt aannemelijk van niet en verwijst daarbij onder andere naar de website zoals die is opgenomen in de Wayback Machine:
De betreffende aflevering van Miljoenenjacht is opgenomen op 16 oktober 2013 en uitgezonden op 3 november 2013.
Onderzoek via Internet Archive heeft aangetoond dat in ieder geval 2 dagen voor de opname, dus op 14 oktober 2013 de spelregels niet waren vermeld op de website van Miljoenenjacht. Na de opname op 16 oktober 2013 zijn de spelregels wél vermeld.
Het plaatje hierboven zijn twee screenshots uit the Internet Archive. Links de FAQ-pagina van 14 oktober, rechts een latere versie. Tja...

Ook interessant trouwens, dat Plasman die website bij Amazon heeft gestald.

Met dank aan een retweet van Christian J.

Gerelateerd
Wayback in de rechtszaal

dinsdag 29 januari 2013

Archive Documentary, part 1


Archive is a documentary focused on the future of long-term digital storage, the history of the Internet and attempts to preserve its contents on a massive scale.
Part one features Brewster Kahle, founder of the Internet Archive and his colleagues Robert Miller, director of books, and Alexis Rossi, director of web collections. On a mission to create universal access to all knowledge, the Internet Archive’s staff have built the world's largest online library, offering 10 petabytes of archived websites, books, movies, music, and television broadcasts.
The video includes a tour of the Internet Archive’s headquarters in San Francisco, the book scanning center, and the book storage facilities in Richmond, California. 
 Die documentaire wil ik te zijner tijd wel helemaal zien.

Gerelateerd
The Internet Archive gaat boeken bewaren
Kerstmis 2012

dinsdag 25 december 2012

Kerstmis 2012


Dit filmpje komt uit de onuitputtelijke archieven van The Internet Archive.
Om al die geweldige filmpjes, boeken, geluidsopnamen en websites te kunnen blijven bewaren, hebben Brewster Kahle en kornuiten natuurlijk geld nodig.

Of zoals Kahle zegt:
Every day 3,000,000 people use our collections.
We have archived over ten petabytes (that's 10,000,000,000,000,000 bytes!) of information, including everything ever written in Balinese. This year we also launched our groundbreaking TV News Search and Borrow service, which former FCC Chairman Newton Minow said "offers citizens exceptional opportunities" to easily do their own fact checking and "to hold powerful public institutions accountable."
Your support helps us build amazing services and keep them free for people around the globe. Please consider making a donation today.
Tot eind dit jaar hebben ze een weldoener gevonden die voor elke dollar die ze deze maand gedoneerd krijgen, er drie bij geeft. Dus, als je nog wat over hebt van je eindejaarsbonus of dertiende maand, Kahle doet er mooie dingen mee.

vrijdag 23 november 2012

Groene IT voor een "web archief"?


De Internet Memory Foundation (voorheen European Archive) is een in 2004 opgerichte non-profit organisatie in Parijs en Amsterdam die zich richt op "het archiveren van internet." Of zoals op hun website staat:
In order to preserve significant and valuable fragments of this information deluge, we think it is necessary to build a large scale, open memory of the Internet.
This memory has to be different from a traditional archive, or library, as much as the internet is different from traditional media. It has to be large enough to be useful, neutral in it’s extension and respectful of person’s rights. We see this memory as embedded in the Internet, augmenting ways information is already used on this media (navigation, search, mining) rather than being separated. By bringing hindsight, it will become a valuable feature of the Internet itself.
Hier vind je het overzicht van de collecties die IM tot nu toe heeft aangelegd (of beheerd, dat is mij niet helemaal duidelijk.) In feite is het "gewoon" een Europese variant van The Internet Archive.
Maar daar gaat het me nu even niet om.
Eergisteren beschreef Chloé Martin op het weblog van IM de nieuwe infrastructuur van het Parijse datacenter van de organisatie. In zijn Amsterdamse datacenter gebruikte IM al servers die speciaal opgebouwd zijn uit energiezuinige onderdelen (zogenaamde red boxes). Maar in hun Parijse vestiging zijn ze nu nog een stap verder gegaan. Een groot deel van de energieconsumptie van datacenters zit in de koeling. Dus die hebben ze in Parijs maar gewoon afgeschaft!
That’s the result of improvements at several levels, including a new design of cylindrical ‘rack’, which enables a free cooling system and a lower energy consumption at all levels (servers, disks and motherboards).
The free-cooling system has been made possible due to a very low thermic diffusion (for 72 nodes, IM datacenter is set between 5300 W and 6300 W depending on the configuration of server class) and due to an innovative design, which enables natural heat extraction.
Here’s a comparison between a regular datacenter and IM datacenter:
Energy
Het nieuwe datacenter is dus een kleine acht keer zuiniger dan een standaard inrichting. Dat is nogal een verschil!

Gerelateerd
Datacenters verbruiken stroom, heel veel stroom
Papierloos en milieuvriendelijk? Dacht het niet... #archivecamp

Het filmpje vond ik in het European Archive in de collectie van TNA en is een Brits "Postbus 51"-filmpje uit de jaren veertig. Helaas is embedden vanuit European Archive (nog) niet mogelijk.

dinsdag 20 december 2011

Zwart-wit, zwart-geel en het Koninkrijk

Wiehad MeinKampf gelezen?
Erwarener- maarhunbeoordelingen warenveelalopvallend waarderend.
In het weekblad van ds.Geelkerken's HersteldVerband, Woord en Geest,
wasin dezomer van 1932 een reeks van zeven lange artikelen verschenen,
gewijd aan het nationaal-socialisme. Hiders antisemitisme was er bij de
schrijver alskoekingegaan, ookin Nederlandhadden, schreefhij, 'de Joodse
marxisten... het volk geïnfecteerd metdematerialistischebacil die nauw
verwant is aan de veroorzaker van hun eigen ziekte, de bekende Joodse,
materialistische mammondicnst'"; het nationaal-socialisme was prijzens-waardig: 'de uiting van een
te lang gemarteld volk, van eenvolk dat door
eenzijdige, onoordeelkundig opgelegde vredesverdragen tot het uiterst van
zijn spankracht is gefolterd'"; welhad de schrijver hier en daar bezwaren
tegen dementaliteit die uit Mein Kampf sprak, maarmenmoestbedenken
datHitler,toen hijditwerkschreef, 'aan eenverbitterde gemoedsstemming
ten prooi was';sindsdien had hijzich 'meer vredelievend betoond", Enkele
maandenlater deed dr. J. A.Nederbragt in het maandblad van de Anti-Revolutionaire Partij,
Anti-Revolutionaire Staatkunde, onder detitel 'Hitler,
Nog even terugkomen op de digitalisering van Het Koninkrijk der Nederlanden in de Tweede Wereldoorlog door het NIOD. Ondertussen zijn de technische problemen opgelost: het NIOD heeft de bestanden op twee servers gezet: http://lou.niod.knaw.nl/ en http://niod.hosting-concepts.nl/. Dat is mooi.
Nog mooier is dat je een zip-bestand met alle pdf's in kleur (1,24 GB) via een torrent op Mininova  kunt downloaden. Dat zouden er meer moeten doen.

Rest nog één andere vraag:
Waarom heeft het NIOD gekozen voor scannen in kleur en in zwart-wit?

Hierboven zie je van boven naar beneden een deel van pagina 167 uit deel 1 in kleur en in zwart-wit. Daaronder staat de OCR-tekst van dezelfde passage.
Het bestand in kleur is ongeveer een derde groter dan het zwart-wit bestand (85 MB vs 64 MB).
Maar, wat is de meerwaarde van de gele pagina's?
Er is een fysieke verklaring voor te geven. Het is de "wetenschappelijke" uitgave van Het Koninkrijk die door het NIOD gedigitaliseerd is en die blijkt te zijn gedrukt op wat dikker, licht geel papier. Voor de publieksuitgave was daarentegen gewoon wit papier gebruikt.
Onder archivarissen is er een oneindige discussie over scannen in kleur of zwart-wit als het gaat om de vervanging van archiefstukken. Mijn standpunt is - zoals waarschijnlijk bekend - dat kleur alleen nodig is als het iets betekent. Onder bibliothecarissen is er volgens mij zo'n zelfde discussie, waarbij de bibliothecarissen het "boek zijn" van een boek benadrukken, terwijl er ook mensen zijn die vooral het "informatieve" van de inhoud benadrukken.
Als je nu naar Het Koninkrijk kijkt, dan lijkt me geen enkele reden te verzinnen om een kleurenreproductie te maken. De gekleurde stofomslagen zijn niet meegescand en alle (in het origineel zwart-wit) plaatjes zijn verwijderd in verband met auteursrechten. Het is ook geen "persoonlijk" exemplaar dat gedigitaliseerd is. Je zou je nog kunnen voorstellen dat aantekeningen die deze of gene gemaakt heeft, digitalisering in kleur noodzakelijk maken. Dus waarom die extra moeite?

En dan kom ik toch weer terug op waar ik vorige week op hintte: de (her)bruikbaarheid van de reproducties.
Het NIOD schrijft zelf:
Gebruikers met een Mac kunnen het bestand beter eerst opslaan en vervolgens met Adobe Acrobat Reader openen. Openen in Safari levert een slecht leesbaar resultaat op.
Waarom dan geen moeite gedaan om de teksten ook nog in een ander exemplaar aan te bieden? The Internet Archive doet dat bijvoorbeeld standaard.
Of waarom niet nog meer tijd besteed aan adequate OCR?
In het voorbeeld hierboven zie je dat de letterherkenning redelijk is: er komt geen foute letter in voor. Wat je echter ook ziet is dat de spatiëring te wensen over laat. Dit heeft bijvoorbeeld tot gevolg dat een zoekactie op "Mein Kampf" in deel 1 negen treffers oplevert, terwijl "MeinKampf" er elf oplevert. Maar dat zijn ze nog niet allemaal, want "MeinKampj" komt ook nog minstens één keer voor (op p. 152).

Ik kan lastig inschatten wat de extra kosten voor de digitale reproducties in kleur zijn geweest, maar totdat iemand me kan uitleggen waarom kleur noodzakelijk was, vind ik het jammer dat die euro's niet aan andere formaten of een betere OCR besteed zijn.

Gerelateerd
Het Koninkrijk, het Journaal en de techniek

woensdag 7 december 2011

URL-verkorters bewaren

Een jaar of twee geleden schreef ik op Archief 2.0 een stukje over het archiveren van tweets en de problemen die het gebruik van URL-verkorters (zoals bit.ly,  tiny.cc of tr.im - o nee, die laatste toch niet) oplevert. Deze week ontdekte ik dat The Internet Archive daar ook een voorziening voor heeft: 301 works
301Works.org is an independent service for archiving URL mappings. The goal of the service is to provide protection for every day users of short URL services by providing transparency and permanence of their mappings. Shortened URL archives are in accordance with 301Works.org membership terms. Items contained in the archives are not publicly accessible at this time.
Het principe is heel simpel:

  1. Participating companies will regularly back up their URL mappings (short and long URLs pairs) to the service provided by the Internet Archive, using one of the supported formats. "Regularly" shall be interpreted as at least once per month. The current support format is a .csv text file, with the following fields: 1/ long url, 2/ short URL, 3/ (optional) click count, and 4/ (optional) date of creation.
  2. In the case of closure of the URL shortening service, a participating company will agree to transfer technical control of the shortening service domain so that 301Works can perform the redirection of shortened URLs. Note: This does not mean that the company will transfer ownership of the domain in such a case. Likewise, a closing company will agree to allow 301Works to publish the mappings so that users can remap any shortened URLs they may be using.
(Ik wilde deze blog beëindigen met de vraag "Heb jij je tabellen al aangeleverd Bob?", omdat ik Bob Coret nog wel eens zie verwijzen naar via.coret.org. Ik dacht dat hij een eigen shortener had gemaakt en gebruikt, maar bij nader inzien gebruikt hij de bit.ly-api, geloof ik.)

Gerelateerd
Universele toegang tot alle kennis

Plaatje: Bit.ly, a simple url shortener van twitter.com/a3munier

zaterdag 3 december 2011

Universele toegang tot alle kennis

Brewster Kahle en The Internet Archive (foto Gawker)
De omvang en groei van Archive.org blijft onvoorstelbaar.
Op Long Now geeft Stewart Brand een korte samenvatting van wat Brewster Kahle en kornuiten allemaal voor elkaar hebben gekregen en krijgen:

Boeken
Voor de "Internet bibliotheek" zijn al 3 miljoen boeken gescand en er staan wereldwijd 29 scanrobots die hier iedere dag 1.000 boeken aan toevoegen, "digitized into every handy ebook format, including robot-audio for the blind and dyslexic."
Even modern heavily copyrighted books are being made available for free as lending-library ebooks you can borrow from physical libraries—100,000 such books so far. (Kahle announced that every citizen of California is now eligible to borrow online from the Oakland Library’s “ePort.”)
Muziek
Er zijn wereldwijd tot nu toe blijkbaar tussen de 2 en 3 miljoen "records" gemaakt, maar die zijn juridisch streng bewaakt. Maar, toen Internet Archive de muzikanten onbeperkte en "eeuwige" opslag aanbod, stroomde de muziek naar binnen.
The Archive audio collection has 100,000 concerts so far (including all the Grateful Dead) and a million recordings, with three new bands every day uploading.
Bewegend beeld
Net als liedjes, zijn de 150.000 commercieel geproduceerde films juridisch onaantastbaar, maar daarnaast zijn er nog 2 miljoen andere films, waarvan er nu al 600.000 toegankelijk zijn. En
In the year 2000, without asking anyone’s permission, the Internet Archive started recording 20 channels of TV all day, every day.
Internet
Toen The Internet Archive in 1996 begon, waren er "slechts" 30 miljoen webpagina's. Nu kopieert de Wayback Machine om de twee maanden "iedere" webpagina, waarna ze doorzoekbaar zijn in de database die 150 miljard pagina's bevat en 6 petabyte groot is.
It has 500,000 users a day making 6,000 queries a second.
Bibliotheek van Alexandrië
Het ideaal van Kahle is een verbeterde versie van de Bibliotheek van Alexandrië, die vooral beroemd is omdat hij verbrand is.
To maintain digital archives, they have to be used and loved, with every byte migrated forward into new media evey five years. For backup, the whole Internet Archive is mirrored at the new Bibliotheca Alexadrina in Egypt and in Amsterdam. (“So our earthquake zone archive is backed up in the turbulent Mideast and a flood zone. I won’t sleep well until there are five or six backup sites.”)
Over de organisatorische duurzaamheid stelt Kahle tenslotte, en ik vermoed dat hij hierbij onder andere op Google doelt, dat non-profit organisaties aantoonbaar langer bestaan dan bedrijven.
It might be it’s because they have softer edges, he surmised, or that they’re free of the grow-or-die demands of commercial competition. Whatever the cause, they are proliferating.
Wat zijn wij dan toch allemaal nog maar krabbelaars...

Aanvulling, zaterdag 3 december 2011, 13:16
Hier kun je een podcast van de hele lezing  van Kahle, waar dit een samenvatting van is, downloaden.

Gerelateerd
The Internet Archive gaat boeken bewaren
Het Nederlandsch Archievenblad, dat is science-fiction

zaterdag 19 november 2011

Het Nederlandsch Archievenblad? Dat is science-fiction

Een van de dingen die ik voor de KVAN moet regelen is het laten digitaliseren van de oude jaargangen van het Nederlands Archievenblad. De KB heeft in zijn tijdschriften-project de jaargangen 1892 - 1940 van het Nederlandsch Archievenblad geselecteerd voor digitalisering. Dus de KVAN heeft voorlopig besloten om die jaargangen niet ook nog eens zelf te gaan laten scannen.
Eerder deze week stuurde een van mijn mede-bestuursleden me de link waar bovenstaande schermafdruk vandaan komt en waaruit blijkt dat oude jaargangen van het Nederlandsch Archievenblad al gescand zijn. Het eerste dat opvalt is natuurlijk dat het Archievenblad is gecategoriseerd als Science Fiction & Fantasy. Maar dat is nog niet alles.
Uit het bijschrift blijkt dat Allofebooks scans te koop aanbiedt die door Google gemaakt zijn voor de University van Michigan en daarna zijn geupload naar The Internet Archive. En na enig verder klikken blijkt dat er in The Internet Archive meer oude jaargangen van het Nederlands Archievenblad te vinden zijn! 
En je kunt ze ook nog eens in platte tekst downloaden en embedden:

Dat Google de jaargangen gedigitaliseerd heeft, blijkt ook uit de aanwezige "google fingers":

Nog verwonderlijker dan dit, vind ik de uitgaven die ik bij Amazon tegen kwam:

Voor krap $17,- kun je een "reproductie" van jaargang zeven van het Nederlandsch Archievenblad kopen:
This is a reproduction of a book published before 1923. This book may have occasional imperfections such as missing or blurred pages, poor pictures, errant marks, etc. that were either part of the original artifact, or were introduced by the scanning process. We believe this work is culturally important, and despite the imperfections, have elected to bring it back into print as part of our continuing commitment to the preservation of printed works worldwide. We appreciate your understanding of the imperfections in the preservation process, and hope you enjoy this valuable book.
Deze boeken worden uitgegeven door Nabu Press of BiblioBazaar, beide eigendom van BiblioLabs, dat zich op zijn website omschrijft als:
a hybrid media-technology company based in Charleston, South Carolina. We work with leading information organizations around the world to curate and commercially distribute historical and academic content.
Het is een wonderlijke wereld, want BiblioBazaar gaf in 2009 272.930 boeken uit, bijna evenveel als alle "traditionele" uitgevers bij elkaar!
En een ander onderdeel van BiblioLabs, BiblioLife, maakt allerlei apps voor iPhone en iPad, onder andere in samenwerking met de Britisch Library.

Gerelateerd
Is Google goed voor geschiedenis

woensdag 6 juli 2011

The Internet Archive gaat boeken bewaren

Al bijna een maand geleden schreef The Internet Archive op zijn weblog dat ze gaan beginnen met het bewaren van een fysiek exemplaar van ieder boek dat ze gescand hebben. De reden die Brewster Kahle en kornuiten hiervoor geven is redelijk schokkend (vind ik dan):
After the Internet Archive digitizes a book from a library in order to provide free public access to people world-wide, these books go back on the shelves of the library. We noticed an increasing number of books from these libraries moving books to “off site repositories” to make space in central buildings for more meeting spaces and work spaces. These repositories have filled quickly and sometimes prompt the de-accessioning of books. A library that would prefer to not be named was found to be thinning their collections and throwing out books based on what had been digitized by Google. While we understand the need to manage physical holdings, we believe this should be done thoughtfully and well.
Een interessant argument van IA om de papieren versies te bewaren is dat de analoge versies de "authentieke" exemplaten zijn en dat er bij twijfel aan de digitale reproductie op terug gevallen kan worden.
En daarom begint IA een enorm depot waarin alle gepubliceerde boeken in optimale omstandigheden bewaard blijven als "back-up". Hierbij moet "alle" natuurlijk met een korreltje zout genomen worden. Blijkbaar zijn er in totaal 100 miljoen boeken verschenen, maar een groot deel daarvan zijn unica, die gewoon in de "normale" bibliotheken bewaard zullen blijven. Maar desondanks mikt IA op het bewaren van 10 miljoen boeken.
Based on this success and the increasing availability of physical materials, a production facility leveraging this design will be launched in June of 2011 in Richmond, California. The essence of the design from the book’s point of view is to have several layers of protection, each able to be monitored and periodically inspected:

  • Books are cataloged, and have acid free paper inserts with information about the book and its location,
  • Boxes store approximately 40 books with labeling on the outside,
  • Pallets hold 24 boxes each,
  • Modified 40′ shipping containers are used as secure and individually controllable environments of 50 or 60 degrees Fahrenheit and 30% relative humidity,
  • Buildings contain shipping containers and environmental systems,
  • Non-profit organizations own and protect the property and its contents.

Het interessante is ook dat IA bibliotheken, verzamelaar en particulieren expliciet uitnodigt om boeken naar hun op te sturen, zodat ze opgenomen kunnen worden. Dit leidde overigens in de commentaren tot een paar "vurige" reacties, waaronder deze:
Larry Moniz
"Sounds like another scam, like Google’s to acquire intellectual property and pass it around WITHOUT conforming to U.S. copyright laws and also paying royalties to authors. Please consider this notification that I prohibit you from copying and retaining any of my work in any form whatsoever."
Larry Moniz
"Not your right under the law to be the guardian of others intellectual property. In my opinion as an author, journalist and publisher, what you are doing is pirating intellectual property. Even the Library of Congress doesn’t actively seek works from all sources. It accepts works from the author or publisher as part of copyright law. You try to sound holier-than-thou and well intentioned, but what’s your real agenda? You also say this being paid for by “funding from stimulus money for jobs programs.” Sounds like a flagrant misuse of stimulus funds."
En anderen merken dan weer op dat het natuurlijk onverstandig is om alle boeken op een plaats te bewaren, in verband met calamiteiten of moedwillige vernietiging.
*zucht*
Ik vind het een indrukwekkend en mooi project en zal boeken die ik om wat voor reden dan ook kwijt moet, zeker naar Richmond sturen.

Gerelateerd
Een bibliotheek om de beschaving te reconstrueren