211service.com
Baidu ha un nuovo trucco per insegnare all'IA il significato del linguaggio
Caratteri tipografici MS Tech / Fonte: Unsplash
All'inizio di questo mese, un gigante tecnologico cinese ha tranquillamente detronizzato Microsoft e Google in una competizione in corso nell'IA. L'azienda era Baidu, l'equivalente cinese più vicino a Google, e la concorrenza era la General Language Understanding Evaluation, altrimenti nota come GLUE.
GLUE è un punto di riferimento ampiamente accettato per quanto bene un sistema di intelligenza artificiale comprende il linguaggio umano. Consiste in nove diversi test per cose come scegliere i nomi di persone e organizzazioni in una frase e capire a cosa si riferisce un pronome simile quando ci sono più potenziali antecedenti. Un modello linguistico che ottiene un punteggio elevato su GLUE, quindi, può gestire diverse attività di comprensione della lettura. Su un punteggio pieno di 100, la persona media ha un punteggio circa 87 punti . Baidu è ora la prima squadra a superare i 90 con il suo modello, ERNIE.
Il classifica pubblica per GLUE è in continua evoluzione e un'altra squadra probabilmente supererà presto Baidu. Ma ciò che è degno di nota del successo di Baidu è che illustra come la ricerca sull'IA tragga vantaggio da una varietà di contributori. I ricercatori di Baidu hanno dovuto sviluppare una tecnica specifica per la lingua cinese per costruire ERNIE (che sta per Enhanced Representation through kNowledge IntEgration). Accade così, tuttavia, che la stessa tecnica renda anche migliore la comprensione dell'inglese.
Il predecessore di ERNIE
Per apprezzare ERNIE, considera il modello a cui si è ispirato: BERT di Google . (Sì, prendono entrambi il nome dal Via del sesamo caratteri .)
Prima della creazione di BERT (Bidirectional Encoder Representations from Transformers) alla fine del 2018, i modelli in linguaggio naturale non erano eccezionali. Erano bravi a predire la parola successiva in una frase, quindi adatti per applicazioni come il completamento automatico, ma non potevano sostenere un solo filo di pensiero anche su un piccolo passaggio. Questo perché non comprendevano il significato, come ad esempio la parola a cui potrebbe riferirsi.
Ma BERT lo ha cambiato. I modelli precedenti hanno imparato a prevedere e interpretare il significato di una parola considerando solo il contesto che appariva prima o dopo di essa, mai entrambi contemporaneamente. Erano, in altre parole, unidirezionale .
BERT, al contrario, considera il contesto prima e dopo una parola tutta in una volta, facendola bidirezionale . Lo fa usando una tecnica nota come mascheratura. In un dato passaggio di testo, BERT nasconde casualmente il 15% delle parole e poi cerca di prevederle dalle restanti. Ciò gli consente di fare previsioni più accurate perché ha il doppio dei segnali su cui lavorare. Nella frase L'uomo è andato al ___ per comprare il latte, ad esempio, sia l'inizio che la fine della frase danno indizi sulla parola mancante. Il ___ è un posto dove puoi andare e un posto dove puoi comprare il latte.
L'uso del mascheramento è una delle innovazioni principali alla base miglioramenti drammatici in compiti in linguaggio naturale ed è parte del motivo per cui modelli come il famigerato GPT-2 di OpenAI possono scrivere una prosa estremamente convincente senza deviare da una tesi centrale.
Dall'inglese al cinese e ritorno
Quando i ricercatori di Baidu hanno iniziato a sviluppare il proprio modello linguistico, hanno voluto basarsi sulla tecnica di mascheramento. Ma si sono resi conto che avevano bisogno di modificarlo per adattarlo alla lingua cinese.
In inglese, la parola funge da unità semantica, il che significa che una parola estratta completamente dal contesto contiene ancora un significato. Lo stesso non si può dire per i caratteri in cinese. Mentre alcuni caratteri hanno un significato intrinseco, come il fuoco (火, huŏ ), acqua (acqua, shuĭ ), o legno (木, cieco ), la maggior parte non lo fa fino a quando non sono legati insieme ad altri. Il carattere 灵 ( lyng ), ad esempio, può significare intelligente (机灵, jīling ) o anima (anima, lingun ), a seconda della sua corrispondenza. E i caratteri in un nome proprio come Boston (波士顿, boshìdùn ) o negli Stati Uniti (Stati Uniti, miscelatore ) non significano la stessa cosa una volta divisi.
Quindi i ricercatori hanno addestrato ERNIE su una nuova versione del mascheramento che nasconde stringhe di caratteri anziché singoli. Lo hanno anche addestrato a distinguere tra stringhe significative e casuali in modo che potesse mascherare di conseguenza le giuste combinazioni di caratteri. Di conseguenza, ERNIE ha una maggiore comprensione di come le parole codificano le informazioni in cinese ed è molto più preciso nel prevedere i pezzi mancanti. Ciò si rivela utile per applicazioni come la traduzione e il recupero di informazioni da un documento di testo.
I ricercatori hanno scoperto molto rapidamente che questo approccio funziona meglio anche per l'inglese. Sebbene non così spesso come il cinese, l'inglese ha allo stesso modo stringhe di parole che esprimono un significato diverso dalla somma delle loro parti. Nomi propri come Harry Potter ed espressioni come chip off the old block non possono essere analizzati in modo significativo separandoli in singole parole.
Quindi per la frase:
Harry Potter è una serie di romanzi fantasy scritti da J. K. Rowling.
BERT potrebbe mascherarlo nel modo seguente:
[maschera] Potter è una serie [maschera] romanzi fantasy [maschera] di J. [maschera] Rowling.
Ma ERNIE lo maschererebbe invece in questo modo:
Harry Potter è [maschera] [maschera] [maschera] romanzi fantasy di [maschera] [maschera] [maschera].
ERNIE apprende quindi previsioni più solide basate sul significato piuttosto che su modelli statistici di utilizzo delle parole.
Una diversità di idee
L'ultima versione di ERNIE utilizza anche diverse altre tecniche di formazione. Considera l'ordinamento delle frasi e le distanze tra di esse, ad esempio, per comprendere la progressione logica di un paragrafo. La cosa più importante, tuttavia, utilizza un metodo chiamato allenamento continuo che gli consente di allenarsi su nuovi dati e nuove attività senza dimenticare quelli appresi in precedenza. Ciò gli consente di migliorare sempre di più nell'esecuzione di un'ampia gamma di attività nel tempo con la minima interferenza umana.
Baidu utilizza attivamente ERNIE per fornire agli utenti risultati di ricerca più applicabili, rimuovere le storie duplicate nel suo feed di notizie e migliorare la capacità del suo assistente AI Xiao Du di rispondere con precisione alle richieste. Ha anche descritto l'ultima architettura di ERNIE in una carta che sarà presentato alla conferenza dell'Association for the Advancement of Artificial Intelligence il prossimo anno. Allo stesso modo in cui il loro team si è basato sul lavoro di Google con BERT, i ricercatori sperano che anche altri trarranno vantaggio dal loro lavoro con ERNIE.
Quando abbiamo iniziato questo lavoro, stavamo pensando in modo specifico ad alcune caratteristiche della lingua cinese, afferma Hao Tian, l'architetto capo di Baidu Research. Ma abbiamo subito scoperto che era applicabile anche oltre.
Per ricevere più storie come questa direttamente nella tua casella di posta, iscriviti alla nostra newsletter AI nominata da Webby The Algorithm. È gratis.