211service.com
Il test di Turing più duro espone la stupidità dei chatbot
Utente: Siri, chiamami un'ambulanza.
Siri: Va bene, d'ora in poi ti chiamerò un'ambulanza.
Apple ha corretto questo errore poco dopo il rilascio del suo assistente virtuale nel 2011. Ma un nuovo concorso mostra che ai computer manca ancora il buon senso necessario per evitare tali imbarazzanti disguidi.
I risultati del concorso sono stati presentati in una conferenza accademica a New York questa settimana e forniscono una misura di quanto lavoro deve essere fatto per rendere i computer veramente intelligenti.

Illustrazione di Max Bode
Il Sfida dello schema di Winograd chiede ai computer di dare un senso a frasi ambigue ma di solito semplici da analizzare per gli esseri umani. Disambiguare le frasi dello schema di Winograd richiede una comprensione del buon senso. Nella sentenza I consiglieri comunali hanno rifiutato il permesso ai manifestanti perché temevano violenze, logicamente non è chiaro a chi si riferisca la parola, anche se gli esseri umani capiscono per via del contesto più ampio.
I programmi inseriti nella sfida erano un po' più che casuali nella scelta del significato corretto delle frasi. I migliori due partecipanti erano corretti il 48 percento delle volte, rispetto al 45 percento se le risposte sono scelte a caso. Per poter richiedere il primo premio di $ 25.000, i partecipanti dovrebbero raggiungere una precisione di almeno il 90%. Le migliori voci congiunte sono arrivate da Quan Liu, ricercatore presso l'Università di Scienza e Tecnologia della Cina, e Nicos Issak, ricercatore presso l'Università aperta di Cipro.
Non sorprende che le macchine fossero a malapena migliori del caso, dice Gary Marco , psicologo ricercatore presso la New York University e consulente del concorso. Questo perché fornire ai computer la conoscenza del buon senso è notoriamente difficile. La conoscenza della codifica manuale richiede molto tempo e per i computer non è semplice conoscere il mondo reale eseguendo analisi statistiche del testo. La maggior parte dei partecipanti alla Winograd Schema Challenge cerca di utilizzare una combinazione di comprensione della grammatica codificata a mano e una base di conoscenza dei fatti.
Marcus, che è anche il cofondatore di una nuova startup di intelligenza artificiale, Geometric Intelligence, afferma che è degno di nota il fatto che Google e Facebook non abbiano preso parte all'evento, anche se i ricercatori di queste aziende hanno suggerito che stanno facendo grandi progressi nella comprensione del linguaggio naturale. Potrebbe essere stato che quei ragazzi sono entrati in questa stanza e hanno ottenuto il cento per cento e hanno detto 'ah!', dice. Ma questo mi avrebbe sbalordito.
Il concorso non serve solo come misura del progresso nell'IA. Mostra anche quanto sarà difficile costruire chatbot più intuitivi e aggraziati e addestrare i computer a estrarre più informazioni dal testo scritto.
I ricercatori di Google, Facebook, Amazon e Microsoft stanno rivolgendo la loro attenzione al linguaggio. Stanno usando le più recenti tecniche di machine learning, in particolare le reti neurali di deep learning, per sviluppare chatbot e assistenti personali più intelligenti e intuitivi (vedi Macchine per insegnarci a capirci). In effetti, con i chatbot e gli assistenti vocali che stanno diventando sempre più comuni e con i notevoli progressi in aree come il riconoscimento delle immagini e del parlato, potresti pensare che le macchine stiano diventando abbastanza brave a capire il linguaggio.
Una delle due voci al primo posto, infatti, utilizzava un approccio di apprendimento automatico all'avanguardia. Il gruppo di Liu, che comprendeva ricercatori della York University di Toronto e del National Research Council of Canada, ha utilizzato il deep learning per addestrare un computer a riconoscere la relazione tra diversi eventi, come giocare a basket e vincere o infortunarsi, da migliaia di testi.
Sono stato felice di vedere utilizzato il deep learning, dice Leora Morgenstern , uno scienziato senior presso Leidos Corporation, una società di consulenza tecnologica, e uno degli organizzatori della sfida.
Il team di Liu afferma che dopo aver risolto un problema con il modo in cui il suo sistema ha analizzato le domande del concorso, è accurato quasi al 60%. Morgenstern avverte, tuttavia, che anche se queste affermazioni fossero confermate, l'accuratezza sarebbe comunque molto peggiore di quella di un essere umano.
Le frasi di Winograd Schema sono state evidenziate per la prima volta come un modo per valutare la comprensione della macchina da Hector Levesque, un ricercatore di intelligenza artificiale presso l'Università di Toronto. Prendono il nome da Terry Winograd, un pioniere nel campo e professore alla Stanford University che ha costruito uno dei primi programmi per computer conversazionali.
La sfida è stata proposta nel 2014 come miglioramento del test di Turing. Alan Turing, un antenato dell'informatica e dell'intelligenza artificiale che negli anni '50 si chiedeva se le macchine avrebbero potuto un giorno pensare come fanno gli umani, suggerì un modo semplice per testare l'intelligenza di una macchina. La sua idea era che una macchina cercasse di ingannare una persona facendogli pensare che stesse conversando con una persona reale in una conversazione di testo.
Il problema con il test di Turing è che spesso è facile per un programma ingannare una persona usando semplici trucchi ed evasioni. Ma un programma non può analizzare lo schema di Winograd o altre frasi ambigue senza una qualche forma di conoscenza generale.
Il concorso potrebbe avere importanti implicazioni pratiche. Arriverà quando inizierai a supportare i dialoghi, dice Charlie Ortiz , ricercatore principale senior presso Nuance, una società che produce software di riconoscimento vocale e interfaccia vocale, che ha sponsorizzato la Winograd Schema Challenge. Ortiz afferma che il ragionamento di buon senso sarà richiesto anche per semplici conversazioni con i computer. Nello shopping, se dico: 'Voglio prendere una custodia per la mia chitarra; dovrebbe essere forte.' Quindi 'it' si riferisce alla custodia o alla chitarra?
Marcus aggiunge che il ragionamento basato sul buon senso diventerà più importante man mano che dispositivi come elettrodomestici intelligenti o gadget indossabili diventeranno più comuni. Quando vuoi fare una domanda sul tuo orologio non puoi scorrere 50 scelte, dice. Quando inizi a parlare con la tua macchina o con il tuo orologio, e ti sbarazzi della modalità di battitura e desideri avere una serie di frasi collegate - questo discorso colloquiale - le persone si riferiscono semplicemente alle cose e devi risolvere questi problemi per rendere funziona.