211service.com
Un progetto di rete neurale radicalmente nuovo potrebbe superare grandi sfide nell'IA
David Duvenaud et al.
David Duvenaud stava collaborando a un progetto che coinvolgeva dati medici quando si è imbattuto in una grave carenza nell'IA.
Un ricercatore di intelligenza artificiale presso l'Università di Toronto, voleva costruire un modello di apprendimento profondo che prevedesse la salute di un paziente nel tempo. Ma i dati delle cartelle cliniche sono un po' disordinati: nel corso della tua vita, potresti visitare il medico in momenti diversi per motivi diversi, generando un'infarinatura di misurazioni a intervalli arbitrari. Una rete neurale tradizionale fa fatica a gestirlo. Il suo design richiede che impari dai dati con chiare fasi di osservazione. Pertanto è uno strumento scadente per modellare processi continui, in particolare quelli che vengono misurati in modo irregolare nel tempo.
La sfida ha portato Duvenaud ei suoi collaboratori all'università e al Vector Institute a riprogettare le reti neurali come le conosciamo. La scorsa settimana il loro carta è stato tra gli altri quattro incoronato miglior documento alla conferenza sui sistemi di elaborazione delle informazioni neurali, uno dei più grandi raduni di ricerca sull'intelligenza artificiale al mondo.
Le reti neurali sono il meccanismo principale che rende il deep learning così potente. Una rete neurale tradizionale è costituita da strati sovrapposti di semplici nodi computazionali che lavorano insieme per trovare schemi nei dati. Gli strati discreti sono ciò che gli impedisce di modellare efficacemente processi continui (ci arriveremo).
In risposta, il design del team di ricerca elimina completamente gli strati. (Duvenaud si affretta a notare che non hanno avuto questa idea. Sono stati solo i primi a implementarla in modo generalizzabile.) Per capire come ciò sia possibile, esaminiamo innanzitutto cosa fanno i livelli.

Come una rete neurale tradizionale trasforma l'immagine di un leone nel nome 'leone'. Jeff Clune/Screenshot
Il processo più comune per addestrare una rete neurale (noto anche come apprendimento supervisionato) prevede l'alimentazione di un gruppo di dati etichettati. Diciamo che tu volessi costruire un sistema che riconosca diversi animali. Daresti da mangiare a una rete neurale immagini di animali abbinate a nomi di animali corrispondenti. Sotto il cofano, inizia a risolvere un folle enigma matematico. Esamina tutte le coppie nome-immagine e calcola una formula che trasforma in modo affidabile l'una (l'immagine) nell'altra (la categoria). Una volta risolto il puzzle, può riutilizzare la formula ancora e ancora per classificare correttamente qualsiasi nuova foto di animali, il più delle volte.
Ma trovare un'unica formula per descrivere l'intera trasformazione da immagine a nome sarebbe eccessivamente ampio e si tradurrebbe in un modello di bassa precisione. Sarebbe come cercare di utilizzare un'unica regola per differenziare cani e gatti. Si potrebbe dire che i cani hanno le orecchie flosce. Ma alcuni cani no e altri gatti fallo, quindi ti ritroverai con molti falsi negativi e positivi.
È qui che entrano in gioco gli strati di una rete neurale. Suddividono il processo di trasformazione in passaggi e lasciano che la rete trovi una serie di formule che descrivono ciascuna una fase del processo. Quindi il primo livello potrebbe includere tutti i pixel e utilizzare una formula per scegliere quelli più rilevanti per i gatti rispetto ai cani. Un secondo livello potrebbe usarne un altro per costruire modelli più grandi da gruppi di pixel e capire se l'immagine ha baffi o orecchie. Ogni strato successivo identificherebbe caratteristiche sempre più complesse dell'animale, fino a quando lo strato finale decide cane sulla base dei calcoli accumulati. Questa suddivisione graduale del processo consente a una rete neurale di costruire modelli più sofisticati, che a loro volta dovrebbero portare a previsioni più accurate.
L'approccio a strati ha servito bene il campo dell'IA, ma ha anche uno svantaggio. Se vuoi modellare qualcosa che si trasforma continuamente nel tempo, devi anche suddividerlo in passaggi discreti. In pratica, se tornassimo all'esempio della salute, ciò significherebbe raggruppare le tue cartelle cliniche in periodi finiti come anni o mesi. Potresti vedere come questo sarebbe inesatto. Se sei andato dal medico l'11 gennaio e di nuovo il 16 novembre, i dati di entrambe le visite verrebbero raggruppati nello stesso anno.
Quindi il modo migliore per modellare la realtà il più vicino possibile è aggiungere più livelli per aumentare la granularità. (Perché non suddividere i tuoi record in giorni o addirittura ore? Avresti potuto andare dal dottore due volte in un giorno!) Portato all'estremo, questo significa che la migliore rete neurale per questo lavoro avrebbe un numero infinito di livelli per modellare infinitesimali cambi di passo. La domanda è se questa idea sia anche pratica.
Se questo inizia a suonare familiare, è perché siamo arrivati esattamente al tipo di problema per cui il calcolo è stato inventato. Il calcolo ti offre tutte queste belle equazioni su come calcolare una serie di cambiamenti attraverso passaggi infinitesimali, in altre parole, ti salva dall'incubo di modellare il cambiamento continuo in unità discrete. Questa è la magia dell'articolo di Duvenaud e dei suoi collaboratori: sostituisce i livelli con le equazioni di calcolo.
Il risultato non è più nemmeno una rete; non ci sono più nodi e connessioni, solo una lastra continua di calcolo. Tuttavia, attenendosi alla convenzione, i ricercatori hanno chiamato questo progetto ODE net - ODE per equazioni differenziali ordinarie. (Devono ancora lavorare sul loro marchio.)
Se il tuo cervello fa male (credimi, anche il mio lo fa), ecco una bella analogia che Duvenaud usa per legare tutto insieme. Considera uno strumento musicale continuo come un violino, dove puoi far scorrere la mano lungo la corda per suonare qualsiasi frequenza desideri; ora considerane uno discreto come un pianoforte, dove hai un numero distinto di tasti per suonare un numero limitato di frequenze. Una rete neurale tradizionale è come un pianoforte: per quanto ci provi, non sarai in grado di suonare una diapositiva. Sarai in grado di approssimare la diapositiva solo riproducendo una scala. Anche se avessi riaccordato il tuo pianoforte in modo che le frequenze delle note fossero molto vicine tra loro, avresti comunque approssimato la diapositiva con una scala. Passare a una rete ODE è come cambiare il tuo pianoforte a un violino. Non è necessariamente sempre lo strumento giusto, ma è più adatto a determinati compiti.
Oltre a essere in grado di modellare il cambiamento continuo, una rete ODE cambia anche alcuni aspetti della formazione. Con una rete neurale tradizionale, devi specificare il numero di strati che desideri nella tua rete all'inizio dell'allenamento, quindi attendere fino al termine dell'allenamento per scoprire quanto è accurato il modello. Il nuovo metodo ti consente di specificare prima la precisione desiderata e troverà il modo più efficiente per allenarsi all'interno di quel margine di errore. D'altra parte, sai fin dall'inizio quanto tempo impiegherà una rete neurale tradizionale per allenarsi. Non tanto quando si utilizza una rete ODE. Questi sono i compromessi che i ricercatori dovranno fare, spiega Duvenaud, quando decideranno quale tecnica utilizzare in futuro.
Attualmente, il carta offre un proof of concept per il design, ma non è ancora pronto per la prima serata, dice Duvenaud. Come ogni tecnica iniziale proposta sul campo, ha ancora bisogno di essere rimpolpata, sperimentata e migliorata fino a poter essere messa in produzione. Ma il metodo ha il potenziale per scuotere il campo, nello stesso modo in cui ha fatto Ian Goodfellow quando ha pubblicato il suo articolo sui GAN.
Molti dei principali progressi nel campo dell'apprendimento automatico sono arrivati nell'area delle reti neurali, afferma Richard Zemel, direttore della ricerca presso il Vector Institute, che non è stato coinvolto nel documento. Il documento probabilmente stimolerà un'intera gamma di lavori di follow-up, in particolare nei modelli di serie temporali, che sono fondamentali nelle applicazioni di intelligenza artificiale come l'assistenza sanitaria.
Ricorda solo che quando le reti ODE esplodono, ne leggi prima qui.
Correzioni: una versione precedente dell'articolo citava erroneamente l'immagine nella parte superiore dell'articolo come una normale equazione differenziale. Mostra le traiettorie delle equazioni differenziali ordinarie neurali. L'articolo è stato anche aggiornato per fare riferimento al nuovo design come 'rete ODE' piuttosto che 'solutore ODE', per evitare confusione con solutori ODE esistenti di altri campi.
__
Questo articolo è apparso originariamente nella nostra newsletter AI The Algorithm. Per riceverlo direttamente nella tua casella di posta, iscriviti qui gratuitamente.