Come il rivoluzionario sistema di intelligenza artificiale di Reuters raccoglie notizie globali

L'avvento di Internet e la conseguente esplosione di informazioni ha reso sempre più difficile per i giornalisti produrre notizie in modo accurato e rapido. Così inizia il team di ricerca e sviluppo dell'agenzia di stampa globale Reuters in un articolo su arXiv questa settimana.





Per Reuters il problema è stato reso più acuto dall'emergere delle fake news come fattore importante per distorcere la percezione degli eventi.

Tuttavia, le agenzie di stampa come l'Associated Press sono andate avanti con i servizi di scrittura di notizie automatizzati. Questi riportano annunci standard come notizie finanziarie e determinati risultati sportivi incollando i dati in modelli pre-scritti: X ha riportato un profitto di Y milioni nel terzo trimestre, in risultati che hanno battuto le previsioni di Wall Street ...

Quindi c'è una pressione significativa su altre agenzie di stampa per automatizzare la produzione di notizie. E oggi, Reuters sottolinea come ha quasi completamente automatizzato l'identificazione delle ultime notizie. Xiaomo Liu e gli amici di Reuters Research and Development e Alibaba affermano che il nuovo sistema funziona bene. In effetti, ha il potenziale per rivoluzionare il mondo delle notizie. Ma solleva anche preoccupazioni su come un tale sistema potrebbe essere ingannato da attori malintenzionati.



Il nuovo sistema si chiama Reuters Tracer. Utilizza Twitter come una sorta di sensore globale che registra gli eventi di notizie mentre stanno accadendo. Il sistema utilizza quindi vari tipi di data mining e machine learning per individuare gli eventi più rilevanti, determinarne l'argomento, classificarne la priorità e scrivere un titolo e un riepilogo. Le notizie vengono quindi distribuite sul filo di notizie globale dell'azienda.

Il primo passo del processo è di sottrarre il flusso di dati di Twitter. Tracer esamina circa 12 milioni di tweet al giorno, il 2% del totale. La metà di questi viene campionata a caso; l'altra metà proviene da un elenco di account Twitter curato dai giornalisti umani di Reuters. Includono i resoconti di altre testate giornalistiche, società significative, individui influenti e così via.

La fase successiva è determinare quando si è verificato un evento di notizie. Tracer lo fa presumendo che si sia verificato un evento se più persone iniziano a parlarne contemporaneamente. Quindi utilizza un algoritmo di clustering per trovare queste conversazioni.



Naturalmente, questi cluster includono spam, pubblicità, chat ordinaria e così via. Solo alcuni di essi si riferiscono ad eventi degni di nota.

Quindi la fase successiva è classificare e dare priorità agli eventi. Tracer utilizza una serie di algoritmi per farlo. Il primo identifica l'argomento della conversazione. Quindi lo confronta con un database di argomenti che il team di Reuters ha raccolto dai tweet prodotti da 31 account di notizie ufficiali, come @CNN, @BBCBreaking e @nytimes, nonché da aggregatori di notizie come @BreakingNews.

In questa fase, l'algoritmo determina anche la posizione dell'evento utilizzando un database di città e parole chiave basate sulla posizione.



Una volta che una conversazione o una voce è potenzialmente identificata come notizia, una considerazione importante è la sua veridicità. Per determinarlo, Tracer cerca la fonte identificando il primo tweet nella conversazione che menziona l'argomento e tutti i siti a cui punta. Quindi consulta un database che elenca noti produttori di notizie false, come il National Report, o siti di notizie satiriche come The Onion.

Infine, il sistema scrive un titolo e un riepilogo e distribuisce le notizie in tutta l'organizzazione Reuters.

Durante le prove, afferma il team di Reuters, il sistema ha funzionato bene. Tracer è in grado di ottenere precisione competitiva, richiamo, tempestività e veridicità nel rilevamento e nella consegna delle notizie, affermano.



E hanno statistiche a sostegno di questo. Il sistema elabora 12 milioni di tweet ogni giorno, rifiutandone quasi l'80% come rumore. Il resto rientra in circa 6.000 cluster che il sistema classifica come diversi tipi di eventi di notizie. Tutto questo è fatto da 13 server che eseguono 10 algoritmi diversi.

In confronto, Reuters impiega circa 2.500 giornalisti in tutto il mondo che insieme generano circa 3.000 avvisi di notizie ogni giorno, utilizzando una varietà di fonti, incluso Twitter. Di questi, circa 250 sono scritti come notizie.

Reuters ha confrontato le storie che Tracer identifica con quelle che appaiono nei feed di notizie di organizzazioni come la BBC e la CNN. I risultati indicano che Tracer può coprire circa il 70% delle notizie con il 2% dei dati di Twitter, affermano Lui e co.

E il sistema funziona sicuramente rapidamente. Il team evidenzia l'esempio della sparatoria a Las Vegas nell'ottobre 2017, che ha provocato la morte di 58 persone. Un testimone ha denunciato l'incidente all'01:22, che ha attivato un cluster Tracer. Tuttavia, il cluster non ha soddisfatto i criteri del sistema per l'inclusione di un evento nel feed di notizie fino all'01:39. Reuters ha segnalato l'incidente all'01:49, affermano Lui e co.

Questo è un lavoro interessante che solleva una serie di domande, in particolare su quanto sia facile manipolare il sistema. Non è difficile immaginare attori malintenzionati che progettano feed di Twitter con l'intento specifico di ingannare Tracer.

Ma è difficile dire se questo sistema sarà più facile da giocare rispetto a quello attuale, in cui gli esseri umani vengono regolarmente ingannati.

Poi c'è il ruolo degli umani nel mondo dell'informazione. Il futuro delle notizie è chiaramente quello della crescente automazione. Come si inseriscono gli esseri umani è ancora da determinare.

Rif: arxiv.org/abs/1711.04068 : Reuters Tracer: verso la produzione automatizzata di notizie utilizzando i dati dei social media su larga scala

nascondere