211service.com
Come IBM intende vincere il rischio!
Per decenni, gli esseri umani hanno lottato per creare macchine in grado di estrarre significato dal linguaggio umano, con tutto il suo disordine, il contesto sottile, l'umorismo e l'ironia. Gli approcci tradizionali richiedono una grande quantità di lavoro manuale in anticipo per rendere il materiale comprensibile agli algoritmi del computer. L'obiettivo finale è rendere questo passaggio non necessario.

Cos'è Watson? : IBM sta preparando un sistema informatico in linguaggio naturale che competerà con gli umani in Jeopardy! della TV, ospitato da Alex Trebek.
IBM spera di avanzare verso questo obiettivo con Watson, un sistema informatico che funzionerà Pericolo! , il popolare gioco televisivo a quiz, contro concorrenti umani. Le dimostrazioni del sistema sono previste quest'anno, con un incontro televisivo finale, completo di hosting da parte di Alex Trebek dello show, l'anno prossimo. Le domande saranno pronunciate ad alta voce da Trebek ma inserite nella macchina in formato testo durante lo spettacolo.
La società non ha ancora pubblicato alcun documento di ricerca che descriva come affronterà il suo sistema Pericolo! domande in stile. Ma David Ferrucci, l'informatico IBM che guida lo sforzo, spiega che il sistema suddivide una domanda in pezzi, cerca nei propri database la conoscenza correlata e infine crea connessioni per assemblare un risultato. Watson non è progettato per eseguire ricerche sul Web e l'obiettivo finale di IBM è un sistema che può vendere ai suoi clienti aziendali che hanno bisogno di rendere più accessibili grandi quantità di informazioni.
Ferrucci descrive come la tecnologia gestirebbe quanto segue Pericolo! domanda in stile: è l'opera menzionata nel testo di una hit numero uno del 1970 di Smokey Robinson and the Miracles.
Il motore Watson utilizza tecniche di elaborazione del linguaggio naturale per suddividere la domanda in componenti strutturali. In questo caso i brani comprendono 1) un'opera; 2) l'opera è citata in una canzone; 3) la canzone è stata un successo nel 1970; e 4) il successo era di Smokey Robinson and the Miracles.
Nel cercare nei suoi database informazioni che potrebbero essere rilevanti per questi segmenti, il sistema potrebbe trovare centinaia di passaggi. Questi potrebbero includere i tre seguenti:
Pagliacci, l'opera su un clown che cerca di tenere nascosti i suoi sentimenti;
Il record di successo della Motown di Smokey Robinson del ' Lacrime di un clown anni '60;
Tears of a Clown by the Miracles raggiunse il primo posto nel Regno Unito nel 1970.
Analizzando questi passaggi, Watson può identificare Pagliacci come un'opera, anche se questo da solo non sarebbe di grande aiuto, dal momento che molti altri passaggi identificano anche i nomi delle opere. Il secondo risultato identifica un disco di successo, The Tears of a Clown, di Smokey Robinson, che il sistema giudica essere probabilmente la stessa cosa di Smokey Robinson and the Miracles. Tuttavia, molti altri titoli di canzoni verrebbero generati in modo simile. Anche la probabilità che il risultato sia accurato sarebbe giudicata bassa, perché la canzone è associata agli anni '60 e non al 1970. Il terzo passaggio, tuttavia, rafforza l'idea che The Tears of a Clown sia stato un successo nel 1970, a condizione che il sistema determina che The Miracles si riferisce alla stessa cosa di Smokey Robinson and the Miracles.
Dal primo di questi tre passaggi, il motore Watson saprebbe che Pagliacci è un'opera su un clown che nasconde i suoi sentimenti. Per stabilire la connessione con Smokey Robinson, il sistema deve riconoscere che le lacrime sono fortemente legate ai sentimenti, e poiché lo sa... Pagliacci parla di un pagliaccio che cerca di tenere nascosti i suoi sentimenti, indovina, correttamente, che Pagliacci è la risposta. Naturalmente, il sistema potrebbe ancora fare la scelta sbagliata a seconda di come le risposte sbagliate possono essere supportate dalle prove disponibili, afferma Ferrucci.
È facile, dice Ferrucci, per i sistemi di linguaggio naturale meno sofisticati concludere che The Tears of a Clown è la risposta mancando il fatto che la richiesta fosse per un'opera a cui fa riferimento quella canzone. Tale conclusione potrebbe essere innescata da passaggi che hanno molte parole chiave che corrispondono alla domanda.
Marti Hearst , un informatico dell'Università della California, Berkeley, afferma che nell'ultimo decennio sono stati compiuti enormi progressi in questo compito dai ricercatori nell'elaborazione del linguaggio naturale. Aggiunge che mettere il sistema di risposta alle domande Watson di IBM contro i migliori umani in un gioco di Pericolo! è un modo divertente per pubblicizzare e mostrare questi progressi, ma nota anche la mancanza di ricerche pubblicate disponibili per l'esame.
Nel frattempo, la Defense Advanced Research Projects Agency (DARPA) annuncerà presto i partecipanti scelti per prendere parte a a sforzo di ricerca quinquennale finalizzato a far progredire lo stato dell'elaborazione del linguaggio naturale. Mi aspetto che l'intera area si riscaldi in modo significativo nei prossimi anni, afferma Dan Weld, un informatico dell'Università di Washington, che guida un gruppo che ha chiesto di partecipare allo sforzo DARPA.
Indipendentemente dal fatto che Watson di IBM batta o meno gli umani Pericolo! l'anno prossimo, il progetto DARPA porterà sicuramente avanti il campo, afferma Weld. Come notato dalla DARPA nella sua richiesta di proposte di ricerca, i sistemi di elaborazione del linguaggio più intelligenti di oggi sono strettamente focalizzati, mentre i sistemi più ampiamente focalizzati sono più imprecisi. Il coinvolgimento di DARPA concentrerà la ricerca di molte persone nelle migliori università e laboratori di ricerca per spingere su sistemi integrati in grado di leggere effettivamente una vasta gamma di documenti, afferma Weld. La maggior parte dei sistemi attuali affronta piccole parti del puzzle.