Come i dati di Wikipedia stanno rivoluzionando le previsioni dell'influenza

Questa volta l'anno scorso, i Centers for Disease Control and Prevention di Atlanta hanno lanciato un concorso per trovare il modo migliore per prevedere le caratteristiche della stagione influenzale 2013-2014 utilizzando i dati raccolti da Internet. Oggi, Kyle Hickmann dei Los Alamos National Laboratories nel New Mexico e alcuni amici rivelano i risultati del loro modello che utilizzava i dati in tempo reale di Wikipedia per prevedere i dati sulla verità di base raccolti dal CDC che emergono circa due settimane dopo.





Dicono che il loro modello abbia il potenziale per trasformare le previsioni dell'influenza da un'arte nera a una scienza moderna ben fondata come le previsioni meteorologiche.

L'influenza prende tra le 3.000 e le 49.000 vite ogni anno negli Stati Uniti, quindi una previsione accurata può avere un impatto significativo sul modo in cui la società si prepara all'epidemia. L'attuale metodo di monitoraggio delle epidemie influenzali è alquanto antiquato. Si basa su un sistema volontario in cui i funzionari della sanità pubblica riferiscono la percentuale di pazienti che vedono ogni settimana con malattie simil-influenzali. Questa è definita come la percentuale di persone con una temperatura superiore a 100 gradi, una tosse e nessun'altra spiegazione se non l'influenza.

Questi numeri danno un'idea dell'incidenza dell'influenza in qualsiasi momento, ma l'accuratezza è chiaramente limitata. Ad esempio, non tengono conto delle persone con influenza che non cercano cure o delle persone con sintomi simil-influenzali che cercano cure ma non hanno l'influenza.



C'è un altro problema significativo. La rete che riporta questi dati è relativamente lenta. Occorrono circa due settimane affinché i numeri vengano filtrati attraverso il sistema, quindi i dati risalgono sempre a settimane.

Ecco perché il CDC è interessato a trovare nuovi modi per monitorare la diffusione dell'influenza in tempo reale. Google, in particolare, ha utilizzato il numero di ricerche di influenza e sintomi simil-influenzali per prevedere l'influenza in varie parti del mondo. Questo approccio ha avuto un notevole successo, ma anche alcuni sconcertanti fallimenti. Un problema, tuttavia, è che Google non mette a disposizione gratuitamente i propri dati e questa mancanza di trasparenza è una potenziale fonte di guai per questo tipo di ricerca.

Quindi Hickmann e compagni si sono rivolti a Wikipedia. La loro idea è che la variazione del numero di persone che accedono ad articoli sull'influenza sia un indicatore della diffusione della malattia. E poiché Wikipedia rende questi dati liberamente disponibili a qualsiasi parte interessata, è una fonte completamente trasparente che probabilmente sarà disponibile nel prossimo futuro.



Hickman e colleghi utilizzano i dati degli articoli sull'influenza degli anni precedenti per addestrare un algoritmo di apprendimento automatico per individuare il collegamento con i dati sulle malattie simil-influenzali raccolti dal CDC. Hanno quindi utilizzato l'algoritmo per prevedere i livelli di influenza in tempo reale durante la stagione influenzale dell'anno scorso.

I risultati sono un buon predittore dei dati sulla verità di base che il CDC rende disponibili due settimane dopo. I registri di accesso agli articoli di Wikipedia hanno dimostrato di essere altamente correlati con i record storici di malattie simil-influenzali e consentono una previsione accurata dei dati sulle malattie simil-influenzali diverse settimane prima che diventino disponibili, affermano Hickmann e co.

C'è un avvertimento, tuttavia. Un problema è che le previsioni sottostimano significativamente le dimensioni della coda della stagione influenzale. Ciò è probabilmente dovuto al fatto che le persone tendono a non tornare agli articoli sull'influenza di Wikipedia se si sono reinfettate con un altro ceppo di influenza, che è una fonte significativa della malattia a fine stagione. Dal momento che il nostro modello non tiene conto della reinfezione o di molteplici ceppi di influenza, la coda dell'epidemia non è prevista molto dopo che il picco della stagione influenzale è passato, ammettono.



Tuttavia, il lavoro è un passo importante verso un sistema di previsione dettagliato e ben fondato come le previsioni meteorologiche. Una caratteristica utile del loro metodo è che mostra quando il modello devia dai dati di base. Ciò consente di modificarlo in tempo reale per tenere conto di queste differenze, proprio come le previsioni del tempo.

La previsione delle malattie è una scienza agli albori, ma ha il potenziale per migliorare drasticamente il livello di preparazione del mondo medico alle epidemie. Le stime approssimative con cui i medici hanno dovuto lavorare fino ad ora spesso portano a livelli significativi di eccessiva o scarsa preparazione.

Sembra probabile che cambi. E con la stagione influenzale 2014-2015 già alle porte, prima è, meglio è.



Rif: arxiv.org/abs/1410.7716 : Previsione della stagione influenzale 2013–2014 utilizzando Wikipedia

nascondere