Un algoritmo riassume sorprendentemente bene il testo lungo

Sig. tecnico





Chi ha il tempo di leggere ogni articolo che vede condiviso su Twitter o Facebook o ogni documento rilevante per il suo lavoro? Con l'aumentare del sovraccarico di informazioni, i computer potrebbero diventare la nostra unica speranza per gestire un diluvio crescente di documenti. E può diventare una routine fare affidamento su una macchina per analizzare e parafrasare articoli, documenti di ricerca e altro testo per te.

Un algoritmo sviluppato dai ricercatori di Salesforce mostra come i computer potrebbero eventualmente assumere il compito di riassumere i documenti. Utilizza diversi trucchi di apprendimento automatico per produrre frammenti di testo sorprendentemente coerenti e accurati da pezzi più lunghi. E sebbene non sia ancora buono come una persona, suggerisce come la condensazione del testo potrebbe alla fine diventare automatizzata.

L'algoritmo ha prodotto, ad esempio, il seguente riassunto di un recente New York Times articolo su Facebook che cerca di combattere le fake news in vista delle imminenti elezioni nel Regno Unito:



  • Il social network ha pubblicato lunedì una serie di annunci sui giornali britannici.
  • Ha rimosso decine di migliaia di account falsi in Gran Bretagna.
  • Ha anche affermato che avrebbe assunto 3.000 moderatori in più, quasi raddoppiando il numero di persone in tutto il mondo che cercano contenuti inappropriati o offensivi.

L'algoritmo Salesforce è notevolmente migliore di qualsiasi altro sviluppato in precedenza, secondo uno strumento software comune per misurare l'accuratezza dei riepiloghi di testo.

Non credo di aver mai visto un così grande miglioramento in nessuna attività [di elaborazione del linguaggio naturale], dice Riccardo Socher , scienziato capo di Salesforce. Socher è un nome di spicco nell'apprendimento automatico e nell'elaborazione del linguaggio naturale e la sua startup, MetaMente , è stata acquisita da Salesforce nel 2016.

Il software è ancora molto lontano dall'eguagliare la capacità di un essere umano di catturare l'essenza del testo del documento e altri riepiloghi che produce sono più sciatti e meno coerenti. In effetti, riassumere perfettamente il testo richiederebbe un'intelligenza genuina, inclusa la conoscenza del buon senso e una padronanza del linguaggio.



L'analisi del linguaggio rimane una delle grandi sfide dell'intelligenza artificiale (vedi Problema del linguaggio dell'IA). Ma è una sfida con un enorme potenziale commerciale. Anche un'intelligenza linguistica limitata - la capacità di analizzare le domande scritte o parlate e di rispondere in modi più sofisticati e coerenti - potrebbe trasformare il personal computer. In molti campi specialistici, come la medicina, la ricerca scientifica e il diritto, la condensazione delle informazioni e l'estrazione di approfondimenti potrebbero avere enormi vantaggi commerciali.

Caiming Xiong, uno scienziato ricercatore di Salesforce che ha contribuito al lavoro, afferma che l'algoritmo del suo team, sebbene imperfetto, potrebbe riassumere le notizie quotidiane o fornire una sinossi delle e-mail dei clienti. Quest'ultimo potrebbe essere particolarmente utile per la piattaforma di Salesforce.

L'algoritmo del team utilizza una combinazione di approcci per ottenere il suo miglioramento. Il sistema apprende da esempi di buoni riassunti, un approccio chiamato apprendimento supervisionato, ma impiega anche una sorta di attenzione artificiale al testo che sta ingerendo e producendo. Questo aiuta a garantire che non produca troppi filamenti di testo ripetitivi, un problema comune con gli algoritmi di riepilogo.



Il sistema sperimenta per generare riassunti propri utilizzando un processo chiamato apprendimento per rinforzo. Ispirato dal modo in cui gli animali sembrano imparare, ciò implica fornire un feedback positivo per le azioni che portano verso un obiettivo particolare. L'apprendimento per rinforzo è stato utilizzato per addestrare i computer a fare nuove cose impressionanti, come giocare a giochi complessi o controllare i robot (vedi 10 Breakthrough Technologies 2017: Reinforcement Learning). Coloro che lavorano sulle interfacce conversazionali ora considerano sempre più l'apprendimento per rinforzo come un modo per migliorare i propri sistemi.

Kristian Hammond , professore alla Northwestern University e fondatore di Scienza narrativa , un'azienda che genera report narrativi da dati grezzi, afferma che la ricerca Salesforce è un buon progresso, ma mostra anche i limiti del fare affidamento esclusivamente sull'apprendimento automatico statistico. Ad un certo punto, dobbiamo ammettere che abbiamo bisogno di un po' di semantica e di un po' di conoscenza sintattica in questi sistemi affinché siano fluidi e fluenti, dice Hammond.

Hammond dice che l'uso di un meccanismo di attenzione imita, a un livello molto semplice, il modo in cui una persona presta attenzione a ciò che ha appena detto. Quando dici qualcosa, i dettagli di come lo dici sono guidati dal contesto di ciò che hai detto prima, dice. Questo lavoro è un passo in quella direzione.



Anche il miglioramento delle competenze linguistiche dei computer può rivelarsi importante nella ricerca per far progredire l'intelligenza artificiale. Una startup chiamata Maluba , che è stata acquisita all'inizio di quest'anno da Microsoft, ha recentemente prodotto un sistema in grado di generare domande rilevanti dal testo. Il team di Maluuba ha anche utilizzato una combinazione di apprendimento supervisionato e apprendimento per rinforzo.

Adam Trischler, ricercatore senior presso Maluuba, afferma che porre domande pertinenti è una parte importante dell'apprendimento, quindi è importante anche creare macchine curiose. L'obiettivo finale è usare domande e risposte in un dialogo, dice Trischler. E se una macchina potesse uscire e raccogliere informazioni e poi porre le proprie domande?

nascondere