Il capo dell'IA di Facebook: le macchine potrebbero imparare il buon senso dai video

Yann LeCun afferma che la prossima frontiera della visione artificiale è il software che impara semplicemente osservando il mondo. 9 marzo 2017

Illustrazione di Erik Carter





Cinque anni fa, i ricercatori hanno fatto un improvviso balzo in avanti nell'accuratezza del software in grado di interpretare le immagini. La tecnologia alla base, le reti neurali artificiali, è alla base del recente boom dell'intelligenza artificiale (vedi 10 Breakthrough Technologies 2013: Deep Learning). È per questo che Google e Facebook ora ti consentono di cercare all'interno delle tue foto e ha sbloccato nuove applicazioni per il riconoscimento facciale.

Yann LeCun, direttore del gruppo di ricerca sull'intelligenza artificiale di Facebook e professore alla New York University, ha contribuito a fare da pioniere nell'uso delle reti neurali per la visione artificiale. Dice che ci sono ancora progressi da fare e che potrebbero portare a software con buon senso.

Quanto è buona la visione artificiale ora?



Se hai un'immagine con un oggetto dominante e il nome del gioco è quello di indicare la categoria dell'oggetto, funziona. Finché disponi di dati sufficienti, nell'ordine di 1.000 oggetti per categoria, possiamo riconoscere oggetti molto specifici come automobili di una particolare marca o piante di una particolare specie o cani di una determinata razza. Possiamo anche riconoscere categorie più astratte, ad esempio se le immagini sono paesaggi, tramonti, matrimoni o feste di compleanno. Solo cinque anni fa non era chiaro che questo problema fosse completamente risolvibile. Ma ciò non significa che la visione sia risolta.

Qual è un problema importante che non è stato ancora risolto?

Le persone hanno giocato per diversi anni con l'idea di generare didascalie o descrizioni per immagini e video. Ci sono state, a prima vista, dimostrazioni impressionanti, [ma] quelle non sono così impressionanti come sembrano. Il loro dominio di competenza è molto limitato a qualunque universo su cui li addestriamo. Alla maggior parte dei sistemi, mostri loro immagini con altri tipi di oggetti o situazioni insolite che non hanno mai visto e loro diranno completamente spazzatura al riguardo. Non hanno buon senso.



Qual è la connessione tra visione e buon senso?

Yann LeCun, direttore del gruppo di ricerca sull'intelligenza artificiale di Facebook.

Dipende con chi parli, anche all'interno di Facebook ci sono persone con opinioni diverse su questo. Potresti interagire con un sistema intelligente esclusivamente con il linguaggio. Il problema è che la lingua è un canale con larghezza di banda molto bassa. Molte informazioni che passano attraverso il linguaggio sono dovute al fatto che gli esseri umani hanno molte conoscenze di base per interpretare queste informazioni.



Altre persone pensano che l'unico modo per fornire informazioni sufficienti a un sistema di intelligenza artificiale sia radicarlo nella percezione visiva, [che] è molto, molto più elevata nel contenuto informativo rispetto al linguaggio. Se dici a una macchina Questo è uno smartphone, Questo è un rullo compressore, Ci sono alcune cose che puoi spostare spingendo e altre che non puoi, forse la macchina imparerà le conoscenze di base su come funziona il mondo. Un po' come imparano i bambini.

I bambini imparano molto sul mondo senza istruzioni esplicite, però.

Una delle cose che vogliamo davvero fare è fare in modo che le macchine acquisiscano il grandissimo numero di fatti che rappresentano i vincoli del mondo reale semplicemente osservandolo attraverso video o altri canali. Questo è ciò che permetterebbe loro di acquisire il buon senso, alla fine. Queste sono cose che animali e bambini imparano nei primi mesi di vita: impari una quantità ridicolmente grande sul mondo solo dall'osservazione. Ci sono molti modi in cui le macchine attualmente vengono ingannate facilmente perché hanno una conoscenza molto limitata del mondo.



Quali progressi si stanno facendo per far apprendere il software mediante l'osservazione?

Siamo molto interessati all'idea che un sistema di apprendimento dovrebbe essere in grado di prevedere il futuro. Gli mostri alcuni fotogrammi di video e cerca di prevedere cosa accadrà dopo. Se possiamo addestrare un sistema a fare questo, pensiamo che avremo sviluppato delle tecniche alla base di un sistema di apprendimento non supervisionato. È qui che, a mio parere, è probabile che accadano molte cose interessanti. Le applicazioni per questo non sono necessariamente in visione: è una parte importante del nostro sforzo per fare progressi nell'IA.

(Leggi di più sui progetti di ricerca che cercano di ottenere un software per utilizzare la visione per comprendere il mondo: 'Il software di intelligenza artificiale di Facebook ottiene un pizzico di buon senso', 'Come Google pianifica di risolvere l'intelligenza artificiale')

nascondere