211service.com
Ora le macchine AI stanno imparando a capire le storie
Le tecniche di intelligenza artificiale stanno prendendo d'assalto il mondo. L'anno scorso è stato presentato il team di ricerca DeepMind di Google una macchina che aveva imparato da sola a giocare ai videogiochi arcade . All'inizio di quest'anno, un team di ricercatori cinesi ha dimostrato un sistema di riconoscimento facciale che supera gli esseri umani e la scorsa settimana, ha rivelato il gigante cinese di Internet Baidu un unico sistema di riconoscimento vocale in grado di trascrivere sia l'inglese che il cinese mandarino .
Due fattori lo hanno reso possibile. Il primo è una migliore comprensione delle reti neurali a più livelli e come metterle a punto per compiti specifici. Il secondo è la creazione delle vaste banche dati necessarie per formare queste reti.
Questi database sono estremamente importanti. Per il riconoscimento facciale, ad esempio, una rete neurale deve vedere molte migliaia di immagini del mondo reale in cui i volti da tutte le angolazioni, a volte occlusi, sono chiaramente etichettati. Ciò richiede molte ore di annotazione umana, ma ora è possibile grazie a tecniche di crowdsourcing e servizi Web come Mechanical Turk di Amazon.
I rapidi progressi in quest'area significano che gran parte della frutta a bassa pendenza viene rapidamente ripulita: riconoscimento facciale, riconoscimento di oggetti, riconoscimento vocale e così via. Tuttavia, è molto più difficile creare database per attività di ragionamento più complesse, come la comprensione di storie.
Oggi, le cose iniziano a cambiare grazie al lavoro di Makarand Tapaswi al Karlsruhe Institute of Technology in Germania e ad alcuni amici, che hanno messo insieme un database sui film che dovrebbe fungere da arena di prova per le macchine di deep learning e le loro capacità di ragionare sulle storie.
L'intuizione chiave alla base del loro progetto è che la capacità di rispondere a domande su una storia o un film è un indicatore importante del fatto che sia stata compresa o meno. Quindi l'obiettivo della ricerca è creare quiz a scelta multipla sui film che consistono in una serie di domande insieme a diverse risposte fattibili, solo una delle quali è corretta.
Il loro approccio è diretto. Tapaswi e compagni iniziano raccogliendo sinossi della trama da Wikipedia per circa 300 film. Questi variano in dettaglio da un solo paragrafo a oltre 20 paragrafi.
Collegano questo al film stesso, che è un corpo sostanziale di dati. Un film medio dura circa due ore e ha oltre 198.000 fotogrammi e quasi 2.000 scatti, dicono.
I film mostrano chiaramente informazioni che possono rispondere a domande del tipo Chi ha fatto cosa a chi? Ma non sempre contengono le informazioni per rispondere alle domande sul perché le cose accadono, per le quali a volte è necessaria una conoscenza aggiuntiva del mondo.
Quindi Tapaswi e co raccolgono anche informazioni da database aggiuntivi. Ad esempio, estraggono il testo del video descritto per i non vedenti progettato per contenere informazioni sufficienti per capire cosa sta succedendo senza vederlo; e estraggono anche le sceneggiature originali dei film che sono spesso utili, anche se i registi non sempre le seguono esattamente.
Il team ha quindi chiesto agli annotatori umani di scegliere di leggere le sinossi per ogni film. Hanno quindi dovuto formulare una serie di domande su ogni paragrafo che hanno letto, insieme alla risposta. In media, gli annotatori hanno scritto cinque domande per paragrafo. Dovevano anche evidenziare una sezione del testo che forniva la risposta a ciascuna domanda.
Infine, Tapaswi e colleghi hanno chiesto agli annotatori di leggere ogni domanda e risposta e di trovare quattro risposte sbagliate per creare un quiz a scelta multipla. Il database risultante contiene oltre 7.000 domande su 300 film.
Le domande rientrano in diverse categorie. Ecco alcuni esempi (indovina i film, se puoi):
Nome persona (chi)
Da chi è attratto Epps?
Qual è il soprannome di Jeff Lebowski?
Ragionamento (perché)
Perché Arwen desidera rimanere nella Terra di Mezzo?
Perché Bruce ha paura dei pipistrelli?
Riassunto (cosa)
Quale potere contiene l'essenza verde?
Come spiegato in udienza, qual è stata la causa principale dell'incidente?
Motivo: azione (come)
Come fa Kale a passare il tempo quando inizia per la prima volta la condanna agli arresti domiciliari?
Come fa Hal a sconfiggere Parallasse?
Posizione (dove)
Qual è il nome della palestra dove è stato lasciato il CD?
Dove guida Aragorn la Compagnia?
Azione (cosa)
Cosa fa WALL-E quando pensa che EVE si sia spento?
Cosa fanno Jane e Kevin un anno dopo l'incontro?
Oggetto/Cosa (cosa)
Cosa trova il gruppo nella grotta dei troll?
Cosa distruggono nella sua casa gli uomini che aggrediscono il Dude?
Tipo di persona (cosa)
Chi è Daniel Cleaver?
Qual è la professione di Rachel Dawes?
Sì/No (è, fa)
Madeleine accetta soldi per il suo lavoro per Arthur Case?
È il figlio maggiore di Faramir Denethor?
Causalità (cosa succede)
Cosa fa Mark dopo che Bridget lo visita e gli chiede perdono?
Cosa succede durante l'appuntamento di Miley con Travis?
Questi sono relativamente semplici per gli esseri umani che hanno visto un film. Ma questi ragazzi testano il database su alcune semplici strategie di risposta alle domande basate su macchine per vedere come se la cavano bene. Nessuno funziona particolarmente bene, ma il punto, ovviamente, è aiutare ad addestrare le future generazioni di queste macchine che presumibilmente saranno migliori.
Questa è una grande domanda. Un punto interessante è che le reti neurali profonde necessitano di database di grandi dimensioni per aiutarle ad apprendere. E più complessa è l'attività, più grande deve essere il database.
Quindi una domanda importante è quanto deve essere grande un database per addestrare un algoritmo di deep learning per rispondere a domande sui film. È difficile rispondere, anche entro un ordine di grandezza.
Quindi un obiettivo significativo sarà scoprire se questo database è abbastanza grande da aiutare a limitare le moderne macchine di intelligenza artificiale mentre imparano a svolgere questo compito. È qualcosa che Tapaswi e compagni scopriranno presto.
Nel frattempo, stanno rendendo disponibile il database online nel nuovo anno a: http://movieqa.cs.toronto.edu/home/ . Se la ricerca sull'IA non funziona, dovrebbe almeno essere utile per i quiz sui pub.
Rif: http://arxiv.org/abs/1512.02902 : MovieQA: Capire le storie nei film attraverso la risposta alle domande