211service.com
Il software AI va contro gli studenti di quarta elementare nei test scientifici
In quale stagione dell'anno la pelliccia di un coniglio sarebbe più folta? Un programma per computer chiamato Aristo può dirtelo perché legge di orsi che crescono pelli più spesse durante l'inverno in una guida di studio di quarta elementare e sa che anche i conigli sono mammiferi. Sta studiando per gli esami di scienze standard dello Stato di New York.
Aristo è stato sviluppato dai ricercatori del Istituto Allen per l'Intelligenza Artificiale a Seattle, che vogliono dare alle macchine una misura di buon senso sul mondo. L'amministratore delegato dell'istituto, Oren Etzioni , afferma che il modo migliore per confrontare lo sviluppo della loro prole digitale è utilizzare test progettati per gli scolari. Sta cercando di convincere altri ricercatori di intelligenza artificiale ad adottare test scolastici standardizzati come modo per misurare i progressi nel campo.
Possiamo mettere la nostra comprensione dei progressi nell'IA e nel linguaggio naturale su una base oggettiva, afferma Etzioni. Essere in grado di confrontare i meriti di diversi approcci dovrebbe facilitare l'identificazione di approcci promettenti e potrebbe accelerare i progressi, afferma.
All'inizio di ottobre, l'Allen Institute lancerà un concorso per sfidare i ricercatori a creare software per affrontare questioni scientifiche di terza media. Il concorso è ospitato sul sito Web di data science Kaggle , dove i partecipanti potranno accedere a migliaia di domande pratiche per addestrare il proprio software. Un premio di $ 50.000 verrà assegnato al creatore del software che può ottenere il punteggio migliore su domande che non ha mai visto prima.
In questo momento, Aristo non è vicino a superare l'esame di scienze della quarta elementare. Ciò richiede un punteggio del 65 percento. Aristo può affrontare solo le domande a scelta multipla, che costituiscono circa i due terzi del test. Ha un punteggio di circa il 75 percento su quelli che non coinvolgono i diagrammi e il 45 percento su quelli che lo fanno, afferma Etzioni. Aristo ottiene il 63 percento nelle domande a scelta multipla di terza media che escludono i diagrammi.
Puoi vedere Aristo rispondere a domande selezionate di quarta elementare sul sito web dell'Allen Institute. Il software utilizza algoritmi di ragionamento per rispondere alle domande utilizzando le conoscenze raccolte dalle guide di studio e dal Web.
Trovare un modo per mettere anche un pizzico di buon senso nel software è una sfida importante nell'IA e potrebbe portare i computer ad aiutarci in molti nuovi modi. Se vogliamo costruire sistemi robusti e più naturali con cui le persone possano lavorare, avranno bisogno di queste capacità, afferma Etzioni.
È un punto di vista condiviso da altri ricercatori di spicco, incluso il laboratorio di intelligenza artificiale in espansione di Facebook, che vuole abilitare assistenti virtuali capaci di conversazioni di base (vedi Macchine per insegnarci a capirci). Uno dei motivi per cui gli assistenti virtuali esistenti come Siri di Apple o Cortana di Microsoft sono molto limitati è che devono cavarsela senza il buon senso. Usano ciò che dici per selezionare da un portafoglio di regole preprogrammate.
Ernest Davis , professore alla New York University, concorda sul fatto che un modo per confrontare il buon senso di una macchina potrebbe aiutare il campo. Ma non pensa che usare i test scolastici sia una buona scelta.
L'uso di test creati per i bambini ha il vantaggio di garantire che i ricercatori non rendano troppo facile il benchmark per il loro campo, accidentalmente o intenzionalmente, afferma. Ma poiché i bambini sono molto più bravi a capire il mondo rispetto alle macchine, i test scritti per loro non possono essere utilizzati per sondare le abilità più importanti per fare progressi con il software intelligente, dice.
Ciò che è difficile per gli esseri umani è molto diverso da ciò che è difficile per le macchine, afferma Davis, che lavora anche per dare al software il buon senso. I test standardizzati per gli esseri umani non ottengono un'ottima copertura dei tipi di problemi che sono difficili per i computer.
Davis dice che un'alternativa migliore sarebbe quella di creare domande in stile esame specifiche per le macchine. Una domanda di esempio che ha creato suggerisce che un esame di scienze realizzato per le macchine potrebbe sembrare molto semplice per un bambino di quarta elementare: la mucca preferita di Sally è morta ieri. La mucca sarà probabilmente di nuovo viva a) domani; b) entro una settimana; c) entro un anno; d) entro pochi anni; e) la mucca non sarà mai più viva.
Etzioni ribatte che, sebbene le domande del test scolastico non mettano alla prova direttamente il buon senso molto elementare, lo richiedono implicitamente, perché è necessario per interpretare le domande. Solo usando domande create per gli esseri umani possiamo davvero dire che stiamo misurando macchine rispetto ai nostri standard, dice. Mettere uomini e macchine su un piano di parità ha senso.