Il supercomputer di intelligenza artificiale di Baidu batte Google al riconoscimento delle immagini

Aggiornamento: il 1 giugno 2015 Baidu ha modificato il suo carta tecnica sul suo sistema per ammettere di aver infranto le regole che governano la ImageNet Challenge che la società aveva utilizzato per affermare di aver battuto altri team di ricerca. Gli organizzatori della sfida hanno esaminato la condotta di Baidu e hanno emesso una dichiarazione affermando che i suoi risultati non devono essere considerati direttamente comparabili ai risultati ottenuti da altri.





La società di ricerca cinese Baidu ha costruito questo computer per accelerare la sua ricerca sull'intelligenza artificiale.

Il gigante cinese della ricerca Baidu afferma di aver inventato un potente supercomputer che apporta nuova forza a una tecnica di intelligenza artificiale fornendo al software più potenza per comprendere il parlato, le immagini e il linguaggio scritto.

Il nuovo computer, chiamato Minwa e situato a Pechino, ha 72 potenti processori e 144 processori grafici, noti come GPU. Alla fine di lunedì, Baidu è stato rilasciato un documento sostenendo che il computer era stato utilizzato per addestrare un software di apprendimento automatico che ha stabilito un nuovo record per il riconoscimento delle immagini, battendo un precedente punteggio stabilito da Google.



La nostra azienda sta ora guidando la corsa all'intelligenza artificiale, ha affermato Ren Wu, uno scienziato di Baidu che lavora al progetto, parlando al Summit sulla visione incorporata martedì. La potenza di calcolo di Minwa lo collocherebbe probabilmente tra i 300 computer più potenti del mondo se non fosse specializzato per il deep learning, ha affermato Wu. Penso che questo sia il supercomputer più veloce dedicato al deep learning, ha detto. Abbiamo un grande potere nelle nostre mani, molto più grande dei nostri concorrenti.

La potenza di calcolo è importante nel mondo del deep learning, che ha prodotto innovazioni nel riconoscimento vocale, delle immagini e del volto e ha migliorato i servizi di ricerca di immagini e riconoscimento vocale offerti da Google e Baidu.

La tecnica è una versione truccata di un approccio stabilito per la prima volta decenni fa, in cui i dati vengono elaborati da una rete di neuroni artificiali che gestiscono le informazioni in modi vagamente ispirati ai cervelli biologici. Il deep learning implica l'utilizzo di reti neurali più grandi rispetto a prima, disposte in livelli gerarchici e l'addestramento con raccolte di dati significativamente più grandi, come foto, documenti di testo o registrazioni vocali.



Finora, set di dati e reti più grandi sembrano essere sempre migliori per questa tecnologia, ha affermato Wu. Questo è un modo in cui differisce dalle precedenti tecniche di apprendimento automatico, che avevano iniziato a produrre rendimenti decrescenti con set di dati più grandi. Una volta che hai ridimensionato i tuoi dati oltre un certo punto, non è stato possibile vedere alcun miglioramento, ha affermato Wu. Con il deep learning, continua a salire. Baidu afferma che Minwa rende pratico creare una rete neurale artificiale con centinaia di miliardi di connessioni, centinaia di volte in più rispetto a qualsiasi rete costruita prima.

Un giornale pubblicato lunedì ha lo scopo di fornire un assaggio di ciò che la grinta in più di Minwa può fare. Descrive come il supercomputer è stato utilizzato per addestrare una rete neurale che ha stabilito un nuovo record su un benchmark standard per il software di riconoscimento delle immagini. La ImageNet Classification Challenge, come viene chiamata, prevede l'addestramento del software su una raccolta di 1,5 milioni di immagini etichettate in 1.000 diverse categorie, e poi la richiesta al software di utilizzare ciò che ha imparato per etichettare 100.000 immagini che non ha mai visto prima.

Il software viene confrontato in base alla frequenza con cui le prime cinque ipotesi per una determinata immagine mancano la risposta corretta. Il sistema addestrato sul nuovo computer di Baidu era sbagliato solo il 4,58% delle volte. Il record precedente era del 4,82 percento, segnalato da Google a marzo. Un mese prima, Microsoft aveva segnalato raggiungendo il 4,94 percento, diventando il primo a migliorare la performance umana media del 5,1 percento.



Wu ha affermato che Minwa ha reso possibile addestrare il sistema su immagini a risoluzione più elevata. Ha anche consentito l'uso di una tecnica che ha trasformato le 1,2 milioni di immagini di allenamento originali in due miliardi distorcendole, capovolgendole e alterandone i colori. L'uso di quel set di allenamento più ampio ha migliorato la precisione impedendo al sistema di fissarsi troppo sui dettagli esatti delle immagini di allenamento, ha affermato Wu. Il sistema risultante dovrebbe essere migliore nella gestione delle foto del mondo reale, ha affermato.

Come potrebbero suggerire quei sottili margini di vittoria sulla sfida ImageNet, il deep learning è ora pronto per sfide più difficili del riconoscimento delle immagini, come interpretare video o descrivere immagini in frasi (vedi il software ispirato al cervello di Google Descrive cosa vede nelle immagini complesse). Wu ha affermato che, oltre a pensare a come rendere Minwa ancora più grande e utilizzarlo su video e testo, i ricercatori di Baidu stanno lavorando a modi per ridurre le loro reti neurali addestrate in modo che possano operare su dispositivi mobili.

Ha mostrato un video di un prototipo di app per smartphone in grado di riconoscere diverse razze di cani, utilizzando una versione condensata di una rete di apprendimento profondo addestrata su un predecessore di Minwa. Se sai come sfruttare la potenza di calcolo delle GPU di un telefono, puoi effettivamente riconoscere al volo direttamente dal sensore di immagine, ha affermato.



nascondere