Wikipedia per aggiungere significato alle sue pagine

Come risorsa globale costruita dal tempo libero di milioni di volontari, Wikipedia potrebbe essere l'epitome del Web 2.0. Ma il Fondazione Wikimedia , un'organizzazione senza scopo di lucro che gestisce Wikipedia, tra gli altri progetti, sta ora pensando a come renderlo un fulcro del Web 3.0, o Web semantico.





Ciò significa rendere comprensibili ai computer e agli esseri umani alcuni dei dati sui 15 milioni (e in aumento) di articoli di Wikipedia. Ciò consentirebbe al software di sapere, ad esempio, che i numeri mostrati in una delle colonne in questa tabella che elenca i presidenti degli Stati Uniti sono date. Ciò potrebbe, a sua volta, consentire alle applicazioni che attingono a Wikipedia di generare automaticamente linee temporali storiche o rispondere al tipo di domande di cultura generale che di solito comporterebbe una persona che trova e legge una voce pertinente sul sito.

Al Tecnologia semantica 2010 conferenza a San Francisco il mese scorso, il vicedirettore della fondazione, Erik Möller e collega Trevor Parscal , uno sviluppatore di esperienze utente per Wikimedia, ha mostrato alcuni primi passi compiuti dalla fondazione per esplorare come aggiungere più struttura semantica a Wikipedia. Hanno anche fatto appello alla comunità del Web semantico per aiutare a sviluppare modi per rendere la conoscenza di Wikipedia più accessibile a computer e software.

L'informazione semantica esiste già in Wikipedia e le persone ci stanno già basando, afferma Möller. Sfortunatamente, non stiamo davvero aiutando e devono utilizzare un'elaborazione estesa per farlo.



Un esempio è DBPedia , un database semantico costruito utilizzando un software che raccoglie dati dalle pagine del sito e gestito dalla Libera Università di Berlino e dall'Università di Lipsia, entrambe in Germania. un altro è Base libera , un database di conoscenza a scopo di lucro, gran parte del quale è stato ricavato anche da Wikipedia raschiando. Freebase è la fonte di dati utilizzata dal motore di ricerca che risponde alle domande PowerSet , che è stata acquisita da Microsoft per far parte del suo motore di ricerca Bing.

I primi obiettivi per Möller e Parscal sono i infobox che appaiono come riassunti su molte pagine di Wikipedia e le tabelle nelle voci, come questo che mostra il prodotto nazionale lordo di tutti i paesi del mondo .

Solo essere in grado di riutilizzare quei dati all'interno di Wikipedia sarebbe una grande cosa, dice Yaron Koren , che gestisce una società di consulenza specializzata in Semantic MediaWiki , un'estensione del software MediaWiki utilizzato per creare Wikipedia. Il lavoro manuale che comporta oggi la manutenzione delle numerose tabelle ed elenchi potrebbe essere eliminato, aggiunge. Invece, gli elenchi potrebbero essere generati automaticamente dalle infobox di altre pagine. Sarebbe anche possibile generare mappe, utilizzando le coordinate della posizione che compaiono su alcune pagine, o generare automaticamente linee temporali per riassumere i periodi della storia coperti da molte altre pagine, afferma Möller.



Möller afferma che un esempio del tipo di servizi che potrebbero essere abilitati è WikiPics , sviluppato da Daniel Kinzler alla fondazione tedesca Wikimedia. Kinzler ha raschiato un database di tutti i collegamenti che collegano diverse pagine di Wikipedia disponibili in più lingue e ha creato una ricerca di immagini completamente multilingue. Quando un utente inserisce il termine cavallo, ad esempio, il servizio sa di trovare anche immagini di cheval (francese) e Pferd (tedesco). Stai cercando concetti invece di termini, dice Möller. Tuttavia, per ora il sito si affida al lento processo di raschiatura dell'intera Wikipedia per aggiornare la sua conoscenza. Una Wikipedia semantica manterrebbe un database live che potrebbe essere interrogato in qualsiasi momento.

Wikipedia affronta due grandi sfide nell'abbracciare i concetti semantici, afferma Möller. Uno è che nessuno ha ancora costruito un servizio web semantico sulla scala di un sito come Wikipedia, e non è chiaro se il software esistente come Semantic MediaWiki sia all'altezza del compito, dice.

Una seconda sfida è la caratteristica di Wikipedia più responsabile del suo successo finora: la sua comunità. Pensare di aggiungere una struttura semantica è un'estensione naturale di ciò che Wikipedia deve fare, date le tendenze prevalenti, afferma Andrea Lih della University of Southern California, e autore del libro del 2009 La rivoluzione di Wikipedia . Ma mi preoccupo un po' dell'aspetto del database che ne deriva: l'attrazione dei wiki in primo luogo è nel modo in cui sono stati modificati manualmente dagli umani.

Parscal ha guidato gli sforzi per rendere facile per chiunque aggiungere o modificare i dati di un grande archivio semantico. Abbiamo lavorato su un editor visivo che suggerisce come possiamo aiutare gli utenti a fornire dati strutturati e che rende anche più semplice il processo di modifica, afferma Parscal.

Modificare Wikipedia oggi è già un processo scoraggiante che necessita di miglioramenti, ammette Parscal. Se hai interagito con la nostra interfaccia, spiega, sei stato schiaffeggiato da wikitext (un linguaggio di markup che utilizza un codice speciale attorno al testo per formattare elementi come collegamenti, riferimenti e intestazioni di sezione). Il wikitext per tabelle o infobox, le informazioni più mature per rendere semantico, è particolarmente denso e difficile da capire, dice Parscal. Di recente abbiamo condotto alcuni studi sull'esperienza utente con persone che non lo avevano mai utilizzato prima; furono subito piuttosto frustrati.

In futuro, potrebbe essere possibile eliminare del tutto la necessità per un essere umano di popolare alcune parti di Wikipedia, afferma Möller. Fondamentalmente molti di questi dati probabilmente non dovrebbero essere inseriti dagli esseri umani in primo luogo, dovrebbero solo, diciamo, sondare la fonte di una cifra come il PIL una volta all'anno. Questa è una funzionalità che Koren ha già aggiunto a Semantic MediaWiki, attraverso un'estensione chiamata ExternalData.

nascondere