Il prossimo grande passo per l'IA? Capire il video

Uno screenshot di uno dei video nel set di dati Moments in Time, che potrebbe aiutare l'IA a comprendere meglio i contenuti video. Momenti nel set di dati temporali





Per un computer, riconoscere un gatto o un'anatra in un'immagine fissa è piuttosto intelligente. Ma un test più rigido per l'intelligenza artificiale sarà capire quando il gatto sta cavalcando un Roomba e inseguendo l'anatra in giro per una cucina .

MIT e IBM questa settimana hanno rilasciato un vasto set di dati di video clip accuratamente annotati con i dettagli dell'azione in corso. Il Momenti nel set di dati temporali include frammenti di tre secondi di tutto, dalla pesca alla breakdance.

Molte cose nel mondo cambiano da un secondo all'altro, dice Aude Oliva , uno dei principali ricercatori del MIT e una delle persone dietro il progetto. Se vuoi capire perché sta succedendo qualcosa, il movimento ti fornisce molte informazioni che non puoi catturare in un singolo fotogramma.



L'attuale boom dell'intelligenza artificiale è stato innescato, in parte, dal successo nell'insegnare ai computer a riconoscere il contenuto delle immagini statiche addestrando reti neurali profonde su grandi set di dati etichettati (vedi La tecnica rivoluzionaria che ha cambiato silenziosamente la visione artificiale per sempre).

I sistemi di intelligenza artificiale che interpretano i video oggi, compresi i sistemi che si trovano in alcune auto a guida autonoma, spesso si basano sull'identificazione di oggetti in frame statici piuttosto che sull'interpretazione delle azioni. Lunedì Google ha lanciato uno strumento in grado di riconoscere gli oggetti nel video come parte della sua Cloud Platform, un servizio che include già strumenti di intelligenza artificiale per l'elaborazione di immagini, audio e testo.

La prossima sfida potrebbe essere insegnare alle macchine a capire non solo cosa contiene un video, ma anche cosa sta succedendo nel filmato. Ciò potrebbe avere alcuni vantaggi pratici, forse portando a nuovi potenti metodi di ricerca, annotazione ed estrazione di filmati video. Si tratta anche di fornire ai robot o alle auto a guida autonoma una migliore comprensione di come si sta svolgendo il mondo che li circonda.



Il progetto MIT-IBM è infatti solo uno dei numerosi set di dati video progettati per stimolare i progressi nelle macchine di addestramento per comprendere le azioni nel mondo fisico. L'anno scorso, ad esempio, Google ha rilasciato una serie di otto milioni di video di YouTube taggati chiamato YouTube-8M. Facebook sta sviluppando un set di dati annotato di azioni video chiamato set di scene, azioni e oggetti.

Olga Russakovsky, assistente professore all'Università di Princeton specializzata in visione artificiale, afferma che si è rivelato difficile sviluppare set di dati video utili perché richiedono più spazio di archiviazione e potenza di calcolo rispetto alle immagini fisse. Sono entusiasta di giocare con questi nuovi dati, dice. Penso che la durata di tre secondi sia ottima: fornisce un contesto temporale mantenendo bassi i requisiti di archiviazione e calcolo.

Altri stanno adottando un approccio più creativo. Venti miliardi di neuroni , una startup con sede a Toronto e Berlino, ha creato un set di dati personalizzato pagando lavoratori in crowdsourcing per svolgere compiti semplici. Uno dei cofondatori dell'azienda, Roland Memisevic , afferma di utilizzare anche una rete neurale progettata specificamente per elaborare le informazioni sulla visione temporale.

Le reti addestrate sugli altri set di dati possono dirti se il video mostra una partita di calcio o una festa, dice. Le nostre reti possono dirti se qualcuno è appena entrato nella stanza.

Danny Gutfreund, un ricercatore dell'IBM che ha collaborato al progetto, afferma che il riconoscimento efficace delle azioni richiederà che le macchine apprendano, ad esempio, una persona che esegue un'azione e trasferiscano questa conoscenza a un caso in cui, ad esempio, un animale sta eseguendo la stessa azione. I progressi in questo settore, noto come transfer learning, saranno importanti per il futuro dell'IA. Vediamo come le macchine possono fare questo trasferimento di apprendimento, questa analogia, che facciamo molto bene, dice.

Gutfreund aggiunge che la tecnologia potrebbe avere applicazioni pratiche. Potresti usarlo per la cura degli anziani, per dire se qualcuno è caduto o se ha preso le medicine, dice. Puoi pensare a dispositivi che aiutano i non vedenti.

nascondere