211service.com
In che modo i turchi meccanici hanno raccolto in crowdsourcing un enorme lessico di collegamenti tra parole ed emozioni
Una delle parole d'ordine associate al social web è l'analisi del sentimento. Questa è la capacità di determinare l'opinione o lo stato d'animo di una persona analizzando le parole che pubblica su Twitter, Facebook o qualche altro mezzo.
Molto è stato promesso con questo metodo: la capacità di misurare la soddisfazione nei confronti di politici, film e prodotti; la capacità di gestire al meglio le relazioni con i clienti; la capacità di creare dialoghi per giochi sensibili alle emozioni; la capacità di misurare il flusso delle emozioni nei romanzi; e così via.
L'idea è di automatizzare completamente questo processo: analizzare il flusso di parole prodotte dai siti Web social utilizzando tecniche avanzate di data mining per misurare il sentimento su vasta scala.
Ma tutto questo dipende da quanto bene comprendiamo l'emozione e la polarità (negativa o positiva) che le persone associano a ogni parola o combinazione di parole.
Oggi, Saif Mohammad e Peter Turney del National Research Council Canada di Ottawa svelano un enorme database di parole e le loro emozioni e polarità associate, che hanno assemblato in modo rapido ed economico utilizzando il sito web di crowdsourcing Mechanical Turk di Amazon. Dicono che questo meccanismo di crowdsourcing consente di aumentare le dimensioni e la qualità del database in modo rapido e semplice.
La maggior parte degli psicologi crede che ci siano essenzialmente sei emozioni di base – gioia, tristezza, rabbia, paura, disgusto e sorpresa – o al massimo otto se includi fiducia e anticipazione. Quindi il compito di qualsiasi lessico di parole-emozioni è determinare quanto fortemente una parola sia associata a ciascuna di queste emozioni.
Un modo per farlo è usare un piccolo gruppo di esperti per associare le emozioni a un insieme di parole. Uno dei database più famosi, creato negli anni '60 e noto come database General Inquirer, ha oltre 11.000 parole etichettate con 182 tag diversi, incluse alcune delle emozioni che gli psicologi ora pensano siano le più basilari.
Un database più moderno è il WordNet Affect Lexicon, che ha poche centinaia di parole etichettate in questo modo. Questo ha utilizzato un piccolo gruppo di esperti per etichettare manualmente una serie di parole seme con le emozioni di base. La dimensione di questo database è stata poi notevolmente aumentata associando automaticamente le stesse emozioni a tutti i sinonimi di queste parole.
Uno dei problemi con questi approcci è il tempo necessario per compilare un database di grandi dimensioni, quindi Mohammad e Turney hanno provato un approccio diverso.
Questi ragazzi hanno selezionato circa 10.000 parole da un thesaurus esistente e dai lessici descritti sopra e quindi hanno creato una serie di cinque domande da porre su ciascuna parola che avrebbe rivelato le emozioni e la polarità ad essa associate. Questo è un totale di oltre 50.000 domande.
Hanno quindi posto queste domande a oltre 2000 persone, o Turkers, sul sito Web Mechanical Turk di Amazon, pagando 4 centesimi per ogni serie di domande con risposta adeguata.
Il risultato è un lessico completo di parole-emozioni per oltre 10.000 parole o frasi di due parole che chiamano EmoLex.
Un fattore importante in questa ricerca è la qualità delle risposte che dà il crowdsourcing. Ad esempio, alcuni turchi potrebbero rispondere a caso o addirittura inserire deliberatamente risposte sbagliate.
Mohammad e Turney hanno affrontato questo problema inserendo domande di prova che usano per giudicare se il Turker sta rispondendo bene o meno. In caso contrario, tutti i dati di quella persona vengono ignorati.
Hanno testato la qualità del loro database confrontandolo con quelli precedenti creati da esperti e affermano che si confronta bene. Abbiamo confrontato un sottoinsieme del nostro lessico con i dati del gold standard esistenti per mostrare che le annotazioni ottenute sono davvero di alta qualità, dicono.
Questo approccio ha un potenziale significativo per il futuro. Mohammad e Turney affermano che dovrebbe essere semplice aumentare la dimensione del database di date e allo stesso tempo la stessa tecnica può essere facilmente adattata per creare lessici simili in altre lingue. E tutto questo può essere fatto molto a buon mercato: hanno speso $ 2100 su Mechanical Turk in questo lavoro.
La linea di fondo è che l'analisi del sentiment può essere valida solo quanto il database su cui si basa. Con EmoLex, gli analisti hanno un nuovo strumento per la loro scatola di trucchi.
Rif: arxiv.org/abs/1308.6297 : Crowdsourcing di un lessico di associazione di parole ed emozioni