Estrarre significato da milioni di pagine

I ricercatori dell'Università di Washington hanno sviluppato un motore software che raccoglie i dati esaminando più di 500 milioni di pagine Web. Lo strumento estrae informazioni da miliardi di righe di testo analizzando le relazioni di base tra le parole.





Ricerca di parole : TextRunner esamina automaticamente 500 milioni di pagine Web per estrarre il significato dalle relazioni tra le parole.

Alcuni esperti affermano che questo tipo di estrazione automatizzata delle informazioni costituirà probabilmente la base per ricerche Web di prossima generazione molto più intelligenti, in cui le informazioni vengono prima raccolte e poi combinate in modo intelligente.

Il progetto dell'Università di Washington rappresenta un'espansione di una tecnologia esistente sviluppata lì chiamata TextRunner in termini sia del numero di pagine che della portata degli argomenti che può analizzare.



Il significato di TextRunner è che è scalabile perché non supervisionato, afferma Peter Norvig, direttore della ricerca presso Google, che ha donato il database di pagine Web analizzato da TextRunner. Può scoprire e apprendere milioni di relazioni, non solo una alla volta. Con TextRunner, non c'è un essere umano nel ciclo: trova solo le relazioni da solo.

Norvig spiega che le tecnologie precedenti hanno richiesto più indicazioni da parte del programmatore. Ad esempio, per trovare i nomi delle persone che sono CEO all'interno di milioni di documenti, devi prima addestrare il software con altri esempi, come Steve Jobs è CEO di Apple, Sheryl Sandberg è CEO di Facebook. Norvig aggiunge che Google sta facendo lavoro simile e sta già utilizzando tale tecnologia in contesti limitati.

TextRunner si sbarazza di quel lavoro manuale. Un utente può inserire, ad esempio, uccide i batteri e il motore visualizzerà delle pagine che offrono le intuizioni che il cloro uccide i batteri o la luce ultravioletta uccide i batteri o il calore uccide i batteri - risultati chiamati triple - e forniscono modi per visualizzare in anteprima il testo e quindi visitare la pagina Web da cui proviene.



Il prototipo ha ancora un interfaccia abbastanza semplice e non è pensato per la ricerca pubblica tanto quanto per dimostrare l'estrazione automatizzata di informazioni da 500 milioni di pagine Web, afferma Oren Etzioni , un informatico dell'Università di Washington a capo del progetto. Quello che stiamo mostrando è la capacità del software di ottenere una comprensione rudimentale del testo su una scala e una portata senza precedenti, dice.

Etizioni afferma che la capacità di TextRunner di estrarre significato rapidamente e su vasta scala è scaturita dalla scoperta da parte del suo gruppo di un modello generale per il modo in cui le relazioni vengono espresse in inglese che vale indipendentemente dall'argomento. Ad esempio, il semplice modello 'entità1, verbo, entità2' copre la relazione 'Edison ha inventato la lampadina', così come 'Microsoft ha acquisito Farecast' e molti altri, dice. TextRunner si basa su questo modello, che viene appreso automaticamente dal testo, per analizzare frasi ed estrarre triple con elevata precisione.

TextRunner serve anche come punto di partenza per costruire inferenze da query in linguaggio naturale, che è ciò su cui il gruppo sta ora lavorando. Per fare un semplice esempio: se TextRunner trova una pagina Web che dice che i mammiferi sono a sangue caldo e un'altra pagina Web che dice che i cani sono mammiferi, un motore di inferenza produrrà l'informazione che probabilmente i cani sono a sangue caldo.



Questo è analogo alla tecnologia sviluppata da Powerset, che è stata acquisita da Microsoft lo scorso anno. Poco prima di questa acquisizione, Powerset ha presentato uno strumento che si limitava a estrarre fatti da soli due milioni circa Wikipedia pagine. La tecnologia TextRunner gestisce le pagine di Wikipedia e il testo arbitrario su qualsiasi pagina, inclusi post di blog, cataloghi di prodotti, articoli di giornale e altro.

Questa linea di lavoro ha compiuto importanti progressi nella scala alla quale questi compiti possono essere affrontati, afferma Jon Kleinberg, uno scienziato informatico della Cornell University che ha seguito la ricerca di ricerca dell'Università di Washington. Ha aggiunto che questo lavoro riflette una tendenza crescente verso la progettazione di strumenti di ricerca che combinano attivamente le informazioni che trovano sul Web in una sintesi più ampia.

nascondere