211service.com
Risultato del test del QI: la macchina AI avanzata corrisponde al punteggio di un bambino di quattro anni
I rapidi progressi nella tecnologia di elaborazione delle informazioni negli ultimi anni hanno creato dispositivi informatici con poteri formidabili. Queste macchine sono state a lungo migliori degli umani nell'aritmetica, in alcuni giochi come gli scacchi e, più recentemente, in compiti avanzati di riconoscimento di schemi come il riconoscimento facciale.
Ma una domanda in sospeso è: fino a che punto queste capacità si sommano all'equivalente dell'intelligenza umana? Oggi, riceviamo una sorta di risposta grazie al lavoro di Stellan Ohlsson dell'Università dell'Illinois e di alcuni amici che hanno messo alla prova una delle macchine di intelligenza artificiale più potenti del mondo utilizzando un test del QI standard somministrato agli esseri umani.
I risultati mostrano che, anche se i computer sono diventati molto più potenti negli ultimi anni, hanno un po' di lavoro da recuperare per eguagliare i livelli di prestazioni umane.
Prima un po' di background. La scienza della misurazione delle capacità e delle prestazioni umane è nota come psicometria. Quando si tratta di intelligenza umana, il test psicometrico più ampiamente accettato è il quoziente di intelligenza, o test del QI.
Questo è composto da due parti. La prima è una serie di domande progettate per testare vari aspetti delle prestazioni umane. Il secondo è un database di risultati di test con cui confrontare i risultati futuri. Questo è il modo in cui vengono valutati gli esseri umani; come sopra o sotto la media rispetto al database, per esempio.
I test del QI sono anche progettati per testare gli esseri umani in diverse fasi della loro vita. Quindi è improbabile che un test progettato per gli adulti fornisca informazioni dettagliate sulle prestazioni di bambini di 10 o 4 anni. Quindi il processo di progettazione dei test e creazione del database dei risultati dei test deve essere eseguito per ciascuno di questi gruppi.
Nel corso degli anni, gli informatici hanno creato una serie di macchine di intelligenza artificiale che hanno tentato di ottenere una comprensione razionale del mondo che li circonda. Uno dei più famosi, chiamato ConceptNet, è in fase di sviluppo al MIT dagli anni '90.
Per valutare la sua intelligenza, Ohlsson e colleghi hanno utilizzato un test del QI verbale progettato per consentire ai bambini di testare ConceptNet 4 (da allora ConceptNet 5 è stato rilasciato).
Questo test, noto come Wechsler Preschool and Primary Scale of Intelligence, misura le prestazioni dei bambini in cinque categorie: informazioni, vocabolario, ragionamento delle parole, comprensione e somiglianze.
La categoria delle informazioni contiene domande come: dove puoi trovare un pinguino?
La categoria del vocabolario contiene domande come: Che cos'è ___? come in Cos'è una casa?
Nel ragionamento a parole, un bambino deve identificare qualcosa da tre indizi, come ad esempio: puoi vedere attraverso di esso, è quadrato e puoi aprirlo.
Le domande sulle somiglianze hanno la forma: Finisci quello che dico. X e Y sono entrambi ___ come in Finisci quello che dico. Penna e matita sono entrambe ___. Ciò richiede che il bambino comprenda due concetti e trovi la sovrapposizione tra di loro.
E infine, le domande di comprensione hanno la forma: perché le persone si stringono la mano? Ciò richiede la costruzione di una spiegazione e quindi va oltre il semplice recupero di informazioni.
Ohlsson e co hanno somministrato questo test inviando le domande alla macchina dell'IA in una forma modificata. Ciò richiedeva un po' di programmazione per consentire alle domande di interfacciarsi con la struttura di conoscenza del mondo del computer.
E i risultati costituiscono una lettura interessante. ConceptNet si comporta bene in termini di vocabolario e somiglianze, mediocre sull'informazione e scarso su ragionamento e comprensione delle parole, affermano Ohlsson e co.
In particolare, le risposte che ha dato sono state estremamente sensibili al modo in cui ha interpretato la domanda. Ad esempio, nella categoria di comprensione, alla macchina è stato chiesto Perché ci stringiamo la mano?
Per ConceptNet 4, questo si riduce a una ricerca relativa a tre concetti, due concetti di una parola di stringere la mano e un concetto di due parole di stringere la mano. Se usa tutti questi concetti per cercare una risposta, produce un attacco epilettico.
Tuttavia, costringere la macchina a considerare solo singoli concetti produce risposte molto più soddisfacenti ringraziamenti, flirt e incontra amici.
Ma non sempre funziona. Ad esempio, nella categoria delle informazioni, è stato chiesto alla macchina dove puoi trovare un insegnante?
La macchina scompone questo in una richiesta di tre diversi concetti: quelli di trova e insegnante e del concetto di due parole trova insegnante. Usando tutti questi, dà la risposta correttamente come Ma se Ohlsson e co lo costringono a considerare solo il concetto di due parole trova insegnante, dà le risposte sconcertanti banda o pianoforte.
Il motivo per cui ha problemi con questo tipo di ragionamento in determinate circostanze non è chiaro.
Inoltre, molte delle risposte sbagliate sono del tutto diverse da quelle che darebbero i bambini. Ad esempio, nella categoria del ragionamento delle parole, a ConceptNet 4 sono stati forniti i seguenti indizi: questo animale ha una criniera se è maschio, questo è un animale che vive in Africa e questo è un grosso gatto bruno-giallastro.
Ma le sue prime cinque risposte erano: cane, fattoria, creatura, casa e gatto.
È strano. Il buon senso dovrebbe almeno limitare la risposta agli animali e dovrebbe anche fare la semplice deduzione che, se gli indizi dicono che si tratta di un gatto, allora i tipi di gatti sono le uniche alternative da considerare, affermano Ohlsson e co.
Tutto ciò ha portato Ohlsson e compagni a una chiara conclusione. Il sistema ConceptNet ha ottenuto un VIQ WPPSI-III che è nella media per un bambino di quattro anni, ma al di sotto della media per i bambini di cinque e sette anni, dicono.
È un risultato interessante. Naturalmente, ci sono vari modi in cui il test potrebbe essere migliorato. Uno è fornire al computer capacità di elaborazione del linguaggio naturale. Ciò ridurrebbe la sua dipendenza dalla programmazione necessaria per inserire le domande ed è qualcosa che sta già diventando possibile con assistenti online come Siri, Cortana e Google Now.
Forse il punto più significativo è che questo lavoro è stato svolto su una versione di ConceptNet 4 che risale al 2012. Da allora l'intelligenza artificiale è cambiata rapidamente. Il cambiamento principale è stato il passaggio dalla raccolta di conoscenze all'essere guidati dall'apprendimento. Questi sistemi ora elaborano vasti database di informazioni per ottenere informazioni su lingua, immagini e altri aspetti del mondo. Ciò ha portato a un miglioramento esponenziale delle prestazioni in molte attività, come il riconoscimento facciale.
Prendendo alla lettera il risultato di Ohlsson e co, ci sono voluti 60 anni di ricerca sull'IA per costruire una macchina nel 2012 che potesse avvicinarsi al ragionamento di buon senso di un bambino di quattro anni. Ma la natura dei miglioramenti esponenziali solleva la prospettiva che i prossimi sei anni potrebbero produrre miglioramenti altrettanto drammatici.
Quindi una domanda che dovremmo considerare con urgenza è: con quale tipo di macchina di intelligenza artificiale potremmo essere alle prese nel 2018?
Rif: arxiv.org/abs/1509.03390 : Misurare le prestazioni di un sistema di intelligenza artificiale su un test del QI verbale per bambini piccoli