211service.com
Il sistema di apprendimento profondo di Baidu rivaleggia con le persone al riconoscimento vocale
La principale società cinese di ricerca su Internet, Baidu, ha sviluppato un sistema vocale in grado di riconoscere l'inglese e il mandarino meglio delle persone, in alcuni casi.
Il nuovo sistema, chiamato Discorso profondo 2 , è particolarmente significativo in quanto si basa interamente sull'apprendimento automatico per la traduzione. Mentre i vecchi sistemi di riconoscimento vocale includono molti componenti realizzati a mano per aiutare l'elaborazione e la trascrizione dell'audio, il sistema Baidu ha imparato a riconoscere le parole da zero, semplicemente ascoltando migliaia di ore di audio trascritto.
La tecnologia si basa su una potente tecnica nota come deep learning, che prevede l'addestramento di una rete virtuale multistrato molto ampia di neuroni per riconoscere schemi in grandi quantità di dati. L'app Baidu per smartphone consente agli utenti di effettuare ricerche vocali e include anche un assistente personale a comando vocale chiamato Duer (vedi Baidu's Duer Joins the Personal Assistant Party ). Le query vocali sono più popolari in Cina perché richiede più tempo per inserire il testo e perché alcune persone non sanno come usare il pinyin, il sistema fonetico per trascrivere il mandarino usando i caratteri latini.
Storicamente, le persone vedevano il cinese e l'inglese come due lingue molto diverse, quindi era necessario progettare funzionalità molto diverse, afferma Andrew Ng, ex professore di Stanford e ricercatore di Google, e ora capo scienziato dell'azienda cinese. Gli algoritmi di apprendimento ora sono così generali che puoi semplicemente imparare.
Il deep learning ha le sue radici in idee sviluppate per la prima volta più di 50 anni fa, ma negli ultimi anni nuove tecniche matematiche, combinate con una maggiore potenza del computer e enormi quantità di dati di allenamento, hanno portato a notevoli progressi, soprattutto in compiti che richiedono una sorta di della percezione visiva o uditiva. La tecnica ha già migliorato le prestazioni del riconoscimento vocale e dell'elaborazione delle immagini e grandi aziende tra cui Google, Facebook e Baidu la stanno applicando agli enormi set di dati di loro proprietà.
Il deep learning viene adottato anche per un numero sempre maggiore di attività. Facebook, ad esempio, utilizza il deep learning per trovare i volti nelle immagini che i suoi utenti caricano. E più recentemente ha compiuto progressi nell'uso dell'apprendimento profondo per analizzare il testo scritto (vedi Macchine didattici per capirci). Google ora utilizza il deep learning in oltre 100 progetti diversi, dalla ricerca alle auto a guida autonoma.
Nel 2013, Baidu ha aperto i propri sforzi per sfruttare questa nuova tecnologia, la Istituto di apprendimento profondo , con sede presso la sede centrale dell'azienda a Pechino e nella Silicon Valley. Deep Speech 2 è stato sviluppato principalmente da un team in California.
Nello sviluppo di Deep Speech 2, Baidu ha anche creato una nuova architettura hardware per il deep learning che funziona sette volte più velocemente rispetto alla versione precedente. Il deep learning di solito si basa su processori grafici, perché questi sono utili per i calcoli paralleli intensivi coinvolti.
La velocità raggiunta ci ha permesso di fare esperimenti su una scala molto più ampia di quella che le persone avevano raggiunto in precedenza, afferma Jesse Engel , un ricercatore presso Baidu e uno degli oltre 30 ricercatori citati in un documento che descrive Deep Speech 2. Siamo stati in grado di cercare su molte architetture [di rete neurale] e di ridurre il tasso di errore delle parole del 40%.
Ng aggiunge che questo ha recentemente prodotto risultati impressionanti. Per le frasi brevi, fuori contesto, sembra che stiamo superando i livelli umani di riconoscimento, dice.
Aggiunge: In mandarino, ci sono molti dialetti regionali parlati da popolazioni molto più piccole, quindi ci sono molti meno dati. Questo potrebbe aiutarci a riconoscere meglio i dialetti.