211service.com
Libri di cucina, Wikipedia e Spanglish generato automaticamente: i modi bizzarri con cui i ricercatori di intelligenza artificiale raccolgono i dati
Joe Raedle/Getty Images
I dati sono l'olio che alimenta lo sviluppo dell'IA e ci danno molti dei progressi che diamo per scontati: didascalie di YouTube, consigli sulla musica di Spotify, quelle pubblicità inquietanti che ti seguono su Internet.
Ma quando si tratta di raccogliere dati utili, gli esperti di intelligenza artificiale spesso devono essere creativi. Prendi l'elaborazione del linguaggio naturale (NLP), un sottocampo dell'IA che si concentra sull'insegnamento ai computer come analizzare il linguaggio umano. Alla conferenza annuale sui metodi empirici nella PNL, gli esperti hanno presentato un'ampia gamma di ricerche che hanno attinto alle informazioni raccolte in modi ingegnosi. Di seguito abbiamo riassunto quattro dei nostri progetti preferiti.
SPAGNOLO
Tra i documenti sulla PNL multilingue di quest'anno, Microsoft presentato uno incentrato sull'elaborazione di un linguaggio misto di codice, testo o parlato che passa in modo fluido tra due lingue. Considerando che più della metà della popolazione mondiale è multilingue, quest'area poco studiata è importante.
I ricercatori hanno iniziato con lo spagnolo (spagnolo e inglese), ma non avevano abbastanza testo in spagnolo per addestrare la macchina. Per quanto comune sia il mixaggio di codice nelle conversazioni multilingue, raramente si trova nel testo. Per superare questa sfida, i ricercatori hanno scritto un programma per inserire l'inglese nel traduttore di Microsoft Bing e intrecciare alcune frasi della traduzione spagnola nel testo originale. Il programma si assicurava che le parole e le frasi scambiate avessero lo stesso significato. Proprio così, sono stati in grado di creare tutto lo Spanglish di cui avevano bisogno.
Il modello NLP risultante ha superato i modelli precedenti che erano stati addestrati solo su spagnolo e inglese separatamente. I ricercatori sperano che il loro lavoro alla fine aiuterà a sviluppare chatbot multilingue in grado di parlare naturalmente in un linguaggio misto di codice.
LIBRI DI CUCINA
Le ricette sono ottime per fare il cibo, ma possono anche fornire nutrimento alle macchine. Seguono tutti uno schema simile passo dopo passo e spesso includono immagini che corrispondono al testo, un'eccellente fonte di dati strutturati per le macchine didattiche per comprendere testo e immagini allo stesso tempo. Ecco perché i ricercatori dell'Università Hacettepe in Turchia compilato un gigantesco set di dati di circa 20.000 ricette di cucina illustrate. Sperano che sia una nuova risorsa per il benchmarking delle prestazioni di comprensione congiunta immagine-testo.
Quello che chiamano RecipeQA si baserà sulla ricerca precedente che si è concentrata sulla comprensione della lettura automatica e sulla comprensione visiva separatamente. Nel primo, la macchina deve comprendere una domanda e un relativo passaggio per trovare la risposta; in quest'ultimo, invece, cerca la risposta in una foto correlata. Avere testo e foto fianco a fianco aumenta la complessità dell'attività perché le foto e il testo possono condividere informazioni complementari o ridondanti.
FRESE PIÙ BREVI
Google vuole che l'IA abbellisca la tua prosa. A tal fine, i ricercatori hanno creato il set di dati più grande di sempre per spezzare frasi lunghe in frasi più piccole con significato equivalente. Dove troveresti enormi quantità di dati di modifica? Wikipedia, ovviamente.
Dalla ricca cronologia delle modifiche di Wikipedia, il team di ricerca ha estratto casi in cui le persone dividono frasi lunghe. Il risultato: 60 volte più esempi separati di frasi e 90 volte più parole del vocabolario rispetto a quanto trovato nel precedente set di dati di riferimento per questo compito. Il set di dati comprende anche più lingue.
Quando hanno addestrato un modello di apprendimento automatico sui loro nuovi dati, hanno raggiunto una precisione del 91%. (Qui, la percentuale riflette la proporzione di frasi che hanno mantenuto il loro significato e la correttezza grammaticale dopo essere state riscritte.) In confronto, un modello addestrato su dati precedenti ha raggiunto solo il 32% di precisione. Quando hanno combinato entrambi i set di dati e addestrato un altro modello, è stata raggiunta una precisione del 95%. I ricercatori hanno concluso che potrebbero essere apportati miglioramenti futuri trovando ancora più fonti di dati.
BIAS SOCIAL-MEDIA
Gli studi hanno dimostrato che il linguaggio che generiamo può essere un ottimo predittore della nostra razza, sesso ed età, anche se tali informazioni non sono mai dichiarate esplicitamente. Con questo in mente, i ricercatori della Bar-Ilan University in Israele e dell'Allen Institute for Artificial Intelligence hanno provato a utilizzare l'IA per modificare il testo rimuovendo quegli indicatori incorporati .
Per acquisire dati sufficienti che potessero rappresentare i modelli linguistici in diversi dati demografici, si sono rivolti a Twitter. Hanno raccolto un sacco di tweet da utenti che erano equamente distribuiti tra bianchi non ispanici e neri non ispanici; tra uomini e donne; e tra le persone nella fascia di età 18-34 e sopra i 35 anni.
Hanno quindi utilizzato un approccio contraddittorio, mettendo due reti neurali l'una contro l'altra, per vedere se potevano rimuovere automaticamente gli indicatori demografici intrinseci all'interno dei tweet. Una rete neurale ha cercato di prevedere i dati demografici, mentre l'altra ha cercato di modificare il testo in modo che fosse completamente neutro, con l'obiettivo di ridurre l'accuratezza della previsione del primo modello al 50% (o possibilità). L'approccio alla fine ha mitigato gli indicatori di razza, sesso ed età in modo significativo ma non del tutto.