Come la matematica dello spazio vettoriale aiuta le macchine a individuare il sarcasmo

Nel 1970, l'attivista sociale Irina Dunn ha scarabocchiato uno slogan sul retro della porta di un gabinetto dell'Università di Sydney. Diceva: Una donna ha bisogno di un uomo come un pesce ha bisogno di una bicicletta. La frase divenne virale e alla fine divenne un famoso ritornello per il crescente movimento femminista dell'epoca.





La frase è anche un esempio di sarcasmo. L'umorismo deriva dal fatto che un pesce non ha bisogno di una bicicletta. La maggior parte degli umani ha pochi problemi a individuarlo. Ma mentre varie tecniche avanzate di apprendimento automatico hanno aiutato i computer a individuare altre forme di umorismo, il sarcasmo ancora in gran parte le sfugge.

Queste altre forme di umorismo possono essere individuate cercando, ad esempio, verbi positivi associati a situazioni negative o indesiderabili. E alcuni ricercatori hanno usato questo approccio per cercare il sarcasmo.

Ma il sarcasmo è spesso privo di sentimento. La frase sopra è un buon esempio: non contiene parole che portano sentimenti. Quindi è chiaramente necessaria una nuova strategia se i computer vogliono individuare questo tipo di scherzo.



Oggi, Aditya Joshi dell'Indian Institute of Technology Bombay in India, e alcuni amici, affermano di aver messo a punto proprio una strategia del genere. Dicono che il loro nuovo approccio migliori notevolmente la capacità dei computer di individuare il sarcasmo.

Il loro metodo è relativamente semplice. Invece analizzando il sentimento in una frase, Joshi e compagni analizzano la somiglianza delle parole. Lo fai studiando il modo in cui le parole si relazionano tra loro in un vasto database di articoli di Google News che contengono circa tre milioni di parole. Questo è noto come database Word2Vec.

Questo database è stato ampiamente analizzato per determinare la frequenza con cui le parole appaiono una accanto all'altra. Ciò consente loro di essere rappresentati come vettori in uno spazio dimensionale elevato. Si scopre che parole simili possono essere rappresentate da vettori simili e che la matematica dello spazio vettoriale può catturare semplici relazioni tra di loro. Ad esempio, re – uomo + donna = regina.



Sebbene ci siano chiare differenze tra le parole uomo e donna, occupano parti simili dello spazio vettoriale. Tuttavia, le parole bicicletta e pesce occupano parti dello spazio completamente diverse e quindi sono considerate molto diverse.

Secondo Joshi e compagni, è più probabile che le frasi che contrastano concetti simili con concetti dissimili siano sarcastiche.

Per testare questa idea, studiano la somiglianza tra le parole in un database di citazioni sul sito web di Goodreads. Il team ha scelto solo le citazioni che sono state etichettate come sarcastiche dai lettori e, come controllo, includono anche le citazioni contrassegnate come filosofia. Ciò si traduce in un database di 3.629 citazioni, di cui 759 sarcastiche. Il team ha quindi confrontato i vettori di parole in ogni citazione alla ricerca di somiglianze e differenze.



I risultati costituiscono una lettura interessante. Joshi e compagni affermano che questo approccio di incorporamento delle parole è significativamente migliore di altre tecniche per individuare il sarcasmo. Osserviamo un miglioramento nel rilevamento del sarcasmo, dicono.

Il nuovo approccio non è perfetto, ovviamente. E gli errori che fa sono istruttivi. Ad esempio, non ha individuato il sarcasmo nella citazione seguente: Fantastico. Consigli sulle relazioni da uno dei più ricercati d'America.

Ciò è probabilmente dovuto al fatto che molte di queste parole hanno più significati che l'incorporamento di Word2Vec non cattura.



Un'altra frase sarcastica che non riesce a individuare è: Oh, e suppongo che la mela abbia mangiato il formaggio. In questo caso, mela e formaggio hanno un punteggio di somiglianza elevato e nessuna delle coppie di parole mostra una differenza significativa. Quindi questo esempio non segue la regola che l'algoritmo è progettato per cercare.

L'algoritmo identifica anche erroneamente alcune frasi come sarcastiche. Joshi e colleghi indicano questo, per esempio: Oh mio amore, mi piace svanire in te come un'increspatura svanisce in un oceano, lentamente, silenziosamente e all'infinito.

Gli umani non l'avevano etichettato come sarcastico. Tuttavia, non è difficile immaginare che questa frase venga usata con sarcasmo.

Nel complesso, questo è un lavoro interessante che solleva alcune direzioni per la ricerca futura. In particolare, sarebbe affascinante utilizzare questo tipo di algoritmo per creare frasi sarcastiche e magari usare giudici umani per decidere se funzionano o meno in questo senso.

Al di là di questo è il compito dell'umorismo computazionale stesso. È un obiettivo ambizioso ma forse non del tutto irraggiungibile. Molto umorismo è stereotipato, quindi un algoritmo dovrebbe essere in grado di applicare una tale formula con facilità. Si, come no!

Rif: arxiv.org/abs/1610.00883 : Le funzionalità basate sull'incorporamento di parole sono utili per il rilevamento del sarcasmo?

nascondere