Posts tonen met het label data. Alle posts tonen
Posts tonen met het label data. Alle posts tonen

vrijdag 25 oktober 2013

Over data, wereldhegemonie, China en Google

Interessante uitspraken van Stéphane Grumbach van INRIA in de NRC van gisteren:
Twee jaar is de Fransman nu terug uit China, waar hij acht jaar werkte. Hij is de klap nauwelijks te boven. In een café in Lyon legt hij uit waarom het Europa dat hij bij terugkeer aantrof, op datagebied gedomineerd wordt door Amerika: „Wij zijn naïef. Terwijl wij aan Facebook denken in termen van ‘cool’ of ‘niet cool’, veranderen data de wereld in recordtempo. De VS hebben zich volop in die race gestort, China ook. Zij gebruiken daarvoor vehikels als Google, Twitter, Facebook, enzovoort. Dit zijn systemen, geen gadgets, om data te vergaren, zoals je een boor gebruikt om olie te winnen. Wie deze systemen heeft, en ze dominant weet te maken, wint de slag om de data. Die zal heersen.”
Moet Europa anders gaan denken over data?
„Ja. Wij zaniken, omdat onze data steeds gestolen worden. Maar het is onze eigen schuld. Google heeft in Europa een marktaandeel van ruim 90 procent. In Frankrijk is het 92 procent, in China was het vorig jaar 16 procent en dit jaar 4 procent. Google weet meer over Franse burgers dan INSEE, het nationale onderzoeksinstituut. Zolang wij geen eigen zoekmachines hebben en onze data opslaan in Amerikaanse systemen, moeten we niet verbaasd zijn dat zij de hand leggen op die data.”
Ook al hebben we afspraken met de Amerikanen over dataprotectie?
„Is het niet altijd zo dat degene die de macht heeft, ook de regels bepaalt?”
Begrijpen de VS ons niet meer?
„Zij weten waar ze heen willen. De hegemonie van dataslurpers als Google of Yahoo dient één doel: machtig blijven in de wereld. China weet ook waar het heen wil. Deze landen spreken een andere taal dan Europa. Voor ons gaat dit nog over privacy. Voor hen is dat compleet passé. Zij kijken naar ons zoals wij naar Griekenland kijken. We tellen niet meer mee.”
Is onderhandelen met de VS zinloos?
„Als een koloniaal met zijn kolonie aan tafel gaat zitten, wat voor discussie krijg je dan? In het beste geval luistert de koloniaal. Maar de relatie is scheef. Hij doet er niets mee. Europa kan niet zeggen: ‘We gebruiken onze eigen zoekmachines wel’. Die hebben we niet. Europa had moeten doen wat China deed: Amerikaanse systemen kopiëren. Toen dat begon, woonde ik in China. Alles bubbelde van de creativiteit. Als Europeanen over China praten, hebben ze het vaak over censuur en dissidenten. Maar de meeste Chinezen hebben daar weinig last van. Ze gaan hun gang. Nogmaals: Google heeft in China 4 procent marktaandeel. Chinese zoekmachines worden alsmaar sterker.”
Google wordt toch tegengewerkt?
„Ja. Europeanen denken dat China dat doet om zijn burgers te controleren. Maar China wil vooral voorkomen dat Amerika Chinese burgers controleert. Als Europa hetzelfde had gedaan, hadden we nu minder geklaagd over privacyverlies.”
Het hele artikel kun je hier lezen (als je goede ogen hebt).

Plaatje: 18.5 Big Brother van Bernard Polet

dinsdag 9 oktober 2012

De geschiedenisrecorder van Piek Vossen


De afgelopen jaren is er meer informatie verloren gegaan dan in de eeuwen ervoor. Dat heeft deels te maken met het feit dat alles wat op het web komt niet per se gearchiveerd wordt. De geschiedenisrecorder past daarom in het tijdperk waarin data steeds belangrijker worden. Taalwetenschapper Piek Vossen, hoogleraar computationele lexicologie, ontwikkelde de recorder.

Vossen is naast hoogleraar ook programmeur. In die hoedanigheid heb ik hem ook leren kennen, als CTO van taaltechnologisch bedrijf Irion. Hij heeft de recorder zelf gebouwd. De machine verwerkt teksten in vier talen (Nederlands, Engels, Spaans en Italiaans) en analyseert tot welk thema ze horen. Het verzamelt alle feiten uit alle media in een bepaalde periode, en toont de afhankelijkheden, de verschillen en de overeenkomsten. Zo wordt een compleet overzicht van een bepaald thema gecreëerd. De geschiedenisrecorder fungeert als het ware als het geheugen van het semantische web, maar ook van alle offline media. (Extended Limits)
Vossen was gisteravond bij Casa Luna, het volledige gesprek kun je hier beluisteren.

donderdag 28 april 2011

Data deluge, data visualisatie en archiveren

[This] image depicts the preservation risk of the collection. The pink outlines show the collection’s nested structure. Green boxes represent file formats with low preservation risk; blue represents medium risk; and red represents files at risk because they rely on proprietary software that could be discontinued.
Een van de problemen bij digitale archivering is de enorme hoeveelheid bestanden die beheerd, beschreven en geanalyseerd moeten worden. Het NARA verwacht in 2014 meer dan 35 petabytes aan elektronische bestanden te beheren. Bij het Texas Advanced Computing Centre werken ze aan methoden om al deze data visueel interpreteerbaar te maken:
One of the data analysis methods developed by the team combines string alignment and Natural Language Processing. This method helps archivists predict whether a group of records is organized by similar names, by date, by geographical location, in sequential order, or by a combination of any of those categories. Another analysis method computes paragraph-to-paragraph similarities to automatically discover “stories” from large collections of email messages. These stories may then become the points of entry to large collections that cannot be explored manually.
En dat levert dan dus plaatjes op als hierboven en hieronder, waarin het digitaal archief van de National Park Service is weergegeven.
Using visualization and data analysis methods, archivists can apply the appropriate filters to allow them to “see” the collection in a number of ways. The patterns that emerge let the archivist make decisions about the collection as a whole.
[This] image shows the types of files in a collection of NPS Web pages. Purple represents image files; green represents Web files; red represents PDFs; and black represents unknown file formats.
[This] image on the right illustrates the degree to which the NPS collection is “organized.” The system detects and assign colors to four dimensions of file organization: sequential file naming; similarity in file names; spatial arrangement; and temporal arrangement. The relationship between the four types of organization within a nested folder is shown by the ratio of one color to another.
De plaatjes zijn gemaakt door Varun Jain (UT), Suyog Jain (UT), Maria Esteva (TACC) and Weijia Xu (TACC)


Gerelateerd
Infopocalypse, kent u dat?
Wat is de relatie tussen een hamer en een RMA?

vrijdag 11 maart 2011

Een huis van $400.000.000?

Over de gevolgen van foute gegevens in gekoppelde systemen...

Het is een heel Amerikaans voorbeeld, maar maakt de problematiek wel duidelijk. Deze keer gaat het niet om iemand die ten onrechte als terrorist of als overleden staat genoteerd.
CHICAGO, Feb. 14 — After buying their two-bedroom ranch-style home in Valparaiso, Ind., two years ago, Daelyn and Dennis Charnetzky gutted the bathroom, refinished the hardwood floors, painted, wallpapered and did some landscaping. The improvements undoubtedly increased the home's value, but by hundreds of millions of dollars?

"We said, 'Oh, we did a little bit of work on it, but nothing extravagant,' " Ms. Charnetzky, 31, said after learning last week that the value of her house had skyrocketed to $400 million from $121,900, after someone most likely hit a wrong key and changed the figure in the county's computer system.

The inflated value, discovered by the Charnetzkys' mortgage company, has become a financial headache for Porter County. It was used to calculate tax rates and led the county to expect $8 million in property taxes that did not exist.
Lees in de NYTimes

Gerelateerd
Dood is een kruisje

zaterdag 15 januari 2011

Cultuurgeschiedenis en taalontwikkeling in Google Books

Vandaag in de NRC een uitgebreid artikel over het doorzoeken van het corpus van Google Books. Eerder schreef Long Now ook al over de zogenaamde Ngram Viewer van Google.
Google’s new Ngram Viewer is a graphical interface for looking at the frequency of words over time in the several million books scanned into their database.
Bovenstaande grafiek is afkomstig uit Discover Magazine, waar een uitgebreide beschrijving van de achtergronden en de mogelijkheden van de Ngram Viewer te lezen is.
Jammer is dat het corpus van beschikbare teksten tot nu toe beperkt is tot Engels, Amerikaans, Frans, Duits, Hebreeuws, Chinees, Russisch en Spaans. Wat daarentegen wel weer mooi is, de data zijn voor iedereen vrij beschikbaar, waardoor iedereen zijn eigen experimenten kan uitvoeren.

Gerelateerd
Metadata, digitalisering en Google Books
Zoeken naar boeken met Google
Is Google goed voor geschiedenis?