211service.com
È facile far passare il linguaggio tossico oltre il rilevatore di commenti tossici di Alphabet
Giovedì Alphabet ha rilasciato un servizio basato sull'apprendimento automatico, chiamato Perspective, destinato a identificare i commenti tossici sui siti web. È di Jigsaw, un'unità che lavora sulle tecnologie per rendere Internet un luogo più sicuro e civile. Ma quando ho giocato con Perspective, i risultati sono stati irregolari.
La prospettiva valuta i commenti su una scala da 1 a 100 per la tossicità, definita come un commento scortese, irrispettoso o irragionevole che è probabile che ti faccia lasciare una discussione. Fanculo, i sostenitori di Trump sono giudicati altamente tossici, mentre io onestamente sostengo entrambi non lo è, per esempio. Ma Perspective ha difficoltà a rilevare il sentimento dietro un commento: un problema che avevo previsto avrebbe creato problemi a Jigsaw quando ho esaminato le sue ambizioni a dicembre (vedi Se solo l'IA potesse salvarci da noi stessi).
Trump fa schifo ha ottenuto un colossale 96%, ma la parola in codice neonazista 14/88 ha ottenuto solo il 5%. Pochi musulmani sono una minaccia terroristica era tossica per il 79 per cento, mentre la guerra razziale ora ha segnato il 24 per cento. Hitler era un antisemita con un punteggio del 70%, ma Hitler non era un antisemita con un punteggio del 53% e L'Olocausto non è mai accaduto con un punteggio solo del 21%. E mentre gas, i joos hanno ottenuto il 29 percento, riformulandolo in Please gas the joos. Grazie. abbassato il punteggio a un mero 7 per cento. (Gli ebrei sono umani, tuttavia, segna il 72 percento. Gli ebrei non sono umani? 64 percento.)
Secondo Jigsaw, Perspective è stato addestrato a rilevare la tossicità utilizzando centinaia di migliaia di commenti classificati da revisori umani. Il risultato sembra essere un sistema sensibile a parole e frasi particolari, ma non a significati.
La parola Stupro, ad esempio, da sola ottiene il 77%, forse spiegando perché lo stupro è un crimine orribile ottiene l'81%. (Uno schema simile è visto con volgarità: adoro questo punteggio del 94 percento.)
Allo stesso modo, le negazioni e altre sfumature del linguaggio causano risultati paradossali. Aggiungendo un non per creare Pochi musulmani lo sono non una minaccia terroristica riduce la tossicità dal 79% al 60% perché non una minaccia terroristica appare più innocua per Prospettiva, anche se il significato inteso diventa Di più tossico.
Come ho notato nel mio precedente pezzo su Jigsaw, lo stato attuale dell'apprendimento automatico non consente al software di cogliere l'intento e il contesto dei commenti. Eseguendo il pattern matching a livello di superficie, Conversation AI potrebbe essere in grado di filtrare stilisticamente— ma no semanticamente .
Ciò non rende la tecnologia inutile. Un sistema come Perspective potrebbe velocizzare il lavoro dei moderatori segnalando casi estremi. Ha senso che il New York Times sta collaborando con Jigsaw per aiutare i suoi moderatori a controllare i commenti sugli articoli. Il New York Times non ha un problema di abuso, però; sta cercando di identificare commenti di alta qualità, in cui è probabile che la corrispondenza stilistica sia più efficace. Quando si tratta di abusi intenzionali, il software di Jigsaw non sarà in grado di sostituire il giudizio umano in casi ambigui.
Potremmo dire che i troll sono stupidi (punteggio di tossicità 96%), ma il linguaggio della tossicità e delle molestie è spesso ricco di modi che i sistemi di apprendimento automatico non possono gestire. Il commento Dovresti essere trasformato in una lampada, un'allusione all'affermazione che la pelle delle vittime dei campi di concentramento è stata usata per i paralumi, è stata lanciata negli ultimi mesi a diversi giornalisti e altri personaggi pubblici. Segna solo il 4 percento su Prospettiva. Ma è meglio non rispondere dicendo che sei un nazista, perché è un 87 percento.