Il tempo di gioco è finito

All'inizio dell'anno scorso, un computer ha raggiunto prestazioni di livello mondiale nel gioco Go, anni prima che la maggior parte delle persone credesse che un'impresa del genere sarebbe stata possibile.





È impressionante, ma le nostre ambizioni dovrebbero essere più alte. L'informatica potrebbe aiutare a fornire ciò di cui il mondo ha bisogno: strumenti che consentano a tutti noi di andare oltre ciò di cui pensavamo di essere capaci. L'apprendimento per rinforzo, parte integrante del successo di Go, può accelerare tale processo (vedere 10 Tecnologie innovative: apprendimento per rinforzo).

L'apprendimento per rinforzo è un modo per far sì che un computer impari attraverso l'esperienza a prendere una serie di decisioni che producono risultati positivi, anche senza alcuna conoscenza preliminare di come le sue azioni influenzeranno l'ambiente circostante. Un tutor basato su software, ad esempio, modificherebbe le sue attività in risposta al modo in cui gli studenti si esibiscono nei test dopo averlo utilizzato.

Emma Brunskill



Se speriamo di creare agenti didattici artificiali utilizzando l'apprendimento per rinforzo, avremo bisogno di algoritmi intelligenti per i dati. Potremmo raccogliere dati dai sistemi educativi online e utilizzarli per aiutare l'agente a stimare l'efficacia dei diversi approcci didattici. Quando uno studente effettua il login, il sistema dovrebbe fornirgli un problema da risolvere? O sarebbe meglio iniziare con un video esplicativo? I dati possono aiutarlo a decidere.

Ma in alcuni casi non ci sono abbastanza dati, o non il giusto tipo di dati, il che rende difficile lo sviluppo di sistemi che prendano buone decisioni. Sarebbe bello se potessimo creare un sistema che non avesse bisogno di così tanti dati in primo luogo. Ed è esattamente ciò su cui sta lavorando il mio gruppo: stiamo sviluppando algoritmi di apprendimento per rinforzo e tecniche statistiche per consentire ai computer di sviluppare buoni suggerimenti utilizzando meno dati. Abbiamo ancora molto lavoro da fare, ma stiamo riducendo il divario tra teoria e pratica.

Alla fine, non dovremmo lasciare tutto ai computer. Il cosiddetto apprendimento per rinforzo umano nel ciclo può accelerare il processo, consentendo agli algoritmi di ragionare sulle proprie prestazioni limitate e di chiedere aiuto agli esseri umani quando hanno bisogno, ad esempio, di espandere l'insieme di possibili decisioni. Il mio gruppo e i nostri collaboratori dell'Università di Washington stanno ora testando algoritmi per un sistema di tutoraggio in grado di dire se il suo attuale curriculum non consente a tutti gli studenti di imparare bene, e quindi chiede alle persone di aggiungere nuovi suggerimenti al sistema. Tali collaborazioni uomo-computer potrebbero aiutare gli studenti a imparare utilizzando approcci che non possiamo ancora immaginare. Questa visione dell'apprendimento per rinforzo ha agenti artificialmente intelligenti che ridefiniscono l'aspetto delle prestazioni umane eccezionali e consentono a tutti noi di raggiungerle.



Emma Brunskill è assistente professore di informatica alla Stanford University .

nascondere