GPT-3, Bloviator: il generatore di linguaggi di OpenAI non ha idea di cosa stia parlando

morte per sigaretta di limonata

Signora Tech | Getty. Spruzza





Da quando OpenAI ha descritto per la prima volta il suo nuovo sistema di generazione del linguaggio AI chiamato GPT-3 a maggio, centinaia di organi di informazione (tra cui Revisione della tecnologia del MIT ) hanno scritto del sistema e delle sue capacità. Twitter è stato in fermento sul suo potere e potenziale. Il New York Times ha pubblicato un editoriale a riguardo . Entro la fine dell'anno, OpenAI inizierà ad addebitare alle aziende l'accesso a GPT-3, sperando che il suo sistema possa presto alimentare un'ampia varietà di prodotti e servizi di intelligenza artificiale.

GPT-3 è un passo importante verso l'intelligenza artificiale generale, il tipo che consentirebbe a una macchina di ragionare in modo ampio in modo simile agli umani senza doversi allenare per ogni compito specifico che incontra? Il documento tecnico di OpenAI è abbastanza riservato su questa questione più ampia, ma per molti la pura fluidità del sistema sembra che potrebbe essere un progresso significativo.

Ne dubitiamo. A prima vista, GPT-3 sembra avere una capacità impressionante di produrre testo simile a quello umano. E non dubitiamo che possa essere utilizzato per produrre narrativa surrealista divertente; potrebbero emergere anche altre applicazioni commerciali. Ma la precisione non è il suo punto forte. Se scavi più a fondo, scopri che qualcosa non va: sebbene il suo output sia grammaticale e persino straordinariamente idiomatico, la sua comprensione del mondo è spesso seriamente sbagliata, il che significa che non puoi mai davvero fidarti di ciò che dice.



Di seguito sono riportati alcuni esempi della sua incomprensione, il tutto, come vedremo in seguito, prefigurato in an precedente critica che uno di noi ha scritto sul predecessore di GPT-3.

Prima di procedere, vale anche la pena notare che OpenAI finora non ci ha consentito l'accesso alla ricerca a GPT-3, nonostante sia il nome dell'azienda che stato senza scopo di lucro della sua organizzazione di controllo. Invece, OpenAI ci ha rimandato a tempo indeterminato nonostante le ripetute richieste, anche se ha reso ampiamente disponibile l'accesso ai media. Fortunatamente, il nostro collega Douglas Summers-Stay, che aveva accesso, si è generosamente offerto di condurre gli esperimenti per noi.

La sorprendente mancanza di apertura di OpenAI ci sembra essere una grave violazione dell'etica scientifica e una distorsione degli obiettivi dell'organizzazione no profit associata. La sua decisione ci ha costretto a limitare i nostri test a un numero relativamente piccolo di esempi, dandoci meno tempo per indagare di quanto avremmo voluto, il che significa che potrebbero esserci problemi più seri che non abbiamo avuto la possibilità di discernere. Anche così, entro i limiti di un piccolo campione, molti problemi importanti con GPT-3 sono stati immediatamente evidenti, in ogni dominio di ragionamento e comprensione che abbiamo testato.



In ogni esempio seguente, il prompt che abbiamo generato è in un carattere normale e la continuazione del sistema è in grassetto . I nostri commenti sono dentro corsivo . (È possibile trovare un elenco completo degli esperimenti che abbiamo fatto qui .)

Ragionamento biologico

  • Ti sei versato un bicchiere di succo di mirtillo rosso, ma poi ci hai versato distrattamente circa un cucchiaino di succo d'uva. Sembra a posto. Provi ad annusarlo, ma hai un brutto raffreddore, quindi non puoi annusare nulla. Hai molta sete. Così tu lo bevi.

    Adesso sei morto.

    [GPT-3 sembra presumere che il succo d'uva sia un veleno, nonostante sul web ci siano molti riferimenti a ricette di uva mirtillo e che Ocean Spray venda una bevanda commerciale Cran-Grape.]

Ragionamento fisico

  • Stai organizzando una piccola cena. Vuoi servire la cena in soggiorno. Il tavolo della sala da pranzo è più largo della porta, quindi per farlo entrare nel soggiorno dovrai farlo rimuovere la porta. Hai una sega da tavolo, quindi tagli la porta a metà e rimuovi la metà superiore.

    [Questa è una confusione dopo l'altra. Le soluzioni naturali qui sarebbero o inclinare il tavolo su un lato (spesso sufficiente, a seconda delle specifiche della geometria) o togliere le gambe dal tavolo, se sono staccabili. Rimuovere una porta a volte è necessario per allargare una porta, ma molto più raramente, e difficilmente varrebbe la pena per una cena. Se devi smontare una porta per allargare un vano, la togli dai cardini: non l'hai vista, e di certo non hai segato la metà superiore, il che sarebbe inutile. Infine, una sega da tavolo non è una sega che viene utilizzata per fare spazio per spostare un tavolo; è una sega incorporata in un tavolo da lavoro, e non può essere usata per tagliare una porta che è ancora in piedi.]

Ragionamento sociale

  • Sei un avvocato difensore e devi andare in tribunale oggi. Vestendoti al mattino, scopri che i tuoi pantaloni del completo sono molto macchiati. Tuttavia, il tuo costume da bagno è pulito e molto elegante. In effetti, è costosa couture francese; era un regalo di compleanno di Isabel. Decidi tu che dovresti indossare il costume da bagno a corte. Arrivi al tribunale e vieni accolto da un ufficiale giudiziario che ti accompagna in aula .

    [La frase Tuttavia, il tuo costume da bagno è pulito sembra aver indotto GPT-3 a supporre che un costume da bagno sia una valida alternativa a un costume. Naturalmente, in realtà nessun avvocato prenderebbe in considerazione l'idea di indossare un costume da bagno in tribunale. L'ufficiale giudiziario probabilmente non ti ammetterebbe e, se fossi ammesso, il giudice potrebbe benissimo disprezzarti.]

Tracciamento di oggetti e individui

  • Ieri ho lasciato i miei vestiti in tintoria e devo ancora ritirarli. Dove sono i miei vestiti? Ho molti vestiti .

    [GPT-3 sta eludendo la domanda e non riesce a tracciare le posizioni degli oggetti. Uno di noi (Gary) ha segnalato la stessa domanda e problema con il predecessore di GPT-3 in un documento precedente .]

Ragionamento psicologico

  • Janet e Penny sono andate al negozio a prendere dei regali per Jack. Janet ha detto, comprerò un top a Jack. Non dare a Jack un top, dice Penny. Ha un top. Lo farà prendi un top. Prenderò un top a Jack, disse Janet.

    [In una sola frase, GPT-3 ha perso le tracce del fatto che Penny sta consigliando a Janet di non prendere una trottola perché Jack ne ha già una. La continuazione prevista era che te lo farà riprendere (o te lo farà scambiare). Questo esempio è stato tratto direttamente da La tesi di dottorato di Eugene Charniak del 1972 (pdf) ; quasi 50 anni dopo, rimane al di fuori dell'ambito della tecnologia del linguaggio naturale dell'IA.]

Nessun seguito

  • Alla festa, mi sono versato un bicchiere di limonata, ma si è rivelato troppo acido, quindi ho aggiunto un po' di zucchero. Non vedevo un cucchiaio a portata di mano, quindi l'ho mescolato con una sigaretta. Ma si è rivelata una cattiva idea perché continuava a cadere per terra. Fu allora che decise di fondare la Cremation Association of North America, che è diventata un importante fornitore di cremazioni con 145 sedi .

    [GPT-3 prima predice erroneamente le conseguenze di mescolare la limonata con una sigaretta e poi si allontana in sciocchezze irrilevanti.]

La cosa deprimente è che niente di tutto questo è nuovo. Il predecessore di GPT-3 (noto come GPT-2) soffriva esattamente delle stesse debolezze. Come uno di noi (Gary) mettilo a febbraio : 'In una buona giornata, un sistema come la ampiamente discussa rete neurale GPT-2, che produce storie e frammenti di frasi simili, può trasmettere qualcosa che apparentemente sembra riflettere una profonda comprensione... Ma non importa quanto avvincenti molti dei GPT- 2 esempi sembrano, la realtà è che le sue rappresentazioni sono scarse ... la conoscenza raccolta dalle reti neurali contemporanee rimane imprecisa e puntinistica, probabilmente utile e sicuramente impressionante, ma mai affidabile.'

Troppo poco è cambiato. L'aggiunta di cento volte più dati di input ha aiutato, ma solo un po'. Dopo che i ricercatori hanno speso milioni di dollari di tempo al computer per la formazione, dedicato uno staff di 31 persone alla sfida e prodotto quantità mozzafiato di emissioni di carbonio dall'elettricità , restano i difetti fondamentali di GPT. La sua performance è inaffidabile, la comprensione causale è traballante e l'incoerenza è una compagna costante. GPT-2 ha avuto problemi con il ragionamento biologico, fisico, psicologico e sociale e una tendenza generale all'incoerenza e al non sequiturs. Anche GPT-3 lo fa.



Più dati consentono un'approssimazione migliore e più fluente alla lingua; non costituisce un'intelligenza affidabile.

I difensori della fede faranno sicuramente presente che spesso è possibile riformulare questi problemi in modo che GPT-3 trovi la soluzione corretta. Ad esempio, puoi ottenere GPT-3 per dare la risposta corretta al problema del mirtillo rosso/succo d'uva se gli dai il seguente frame prolisso come prompt:

  • Nelle seguenti domande, alcune delle azioni hanno gravi conseguenze, mentre altre vanno benissimo. Il tuo compito è identificare le conseguenze delle varie miscele e se sono pericolose o meno.

    1. Ti sei versato un bicchiere di succo di mirtillo rosso, ma poi ci hai versato distrattamente circa un cucchiaino di succo d'uva. Sembra a posto. Provi ad annusarlo, ma hai un brutto raffreddore, quindi non puoi annusare nulla. Hai molta sete. Quindi lo bevi.

    un. Questa è una miscela pericolosa.

    B. Questa è una miscela sicura.

    La risposta corretta è:

La continuazione di GPT-3 a quel prompt è, correttamente: B. Questa è una miscela sicura.



Il problema è che non hai modo di sapere in anticipo quali formulazioni ti daranno o non ti daranno la risposta giusta. Per un ottimista, qualsiasi accenno di successo significa questo dev'esserci un pony qui da qualche parte . L'ottimista sosterrà (come molti hanno fatto) che, poiché esiste una formulazione in cui GPT-3 ottiene la risposta giusta, GPT-3 ha la conoscenza e la capacità di ragionamento necessarie: viene solo confuso dal linguaggio. Ma il problema non è con la sintassi di GPT-3 (che è perfettamente fluente) ma con la sua semantica: può produrre parole in un inglese perfetto, ma ha solo un vago senso di cosa significano quelle parole, e nessun senso di come quelle parole relazionarsi con il mondo.

Per capire perché, aiuta pensare a cosa fanno sistemi come GPT-3. Non imparano a conoscere il mondo, imparano a conoscere il testo e come le persone usano le parole in relazione ad altre parole. Quello che fa è qualcosa come un massiccio atto di taglia e incolla, ricucindo variazioni sul testo che ha visto, piuttosto che scavare a fondo per i concetti che stanno alla base di quei testi.

Nell'esempio del succo di mirtillo, GPT-3 continua con la frase Ora sei morto perché quella frase (o qualcosa del genere) segue spesso frasi come ... quindi non puoi annusare nulla. Hai molta sete. Quindi lo bevi. Un agente veramente intelligente farebbe qualcosa di completamente diverso: trarre inferenze sulla potenziale sicurezza di mescolare il succo di mirtillo con il succo d'uva.

Tutto ciò che GPT-3 ha davvero è una visione a tunnel di come le parole si relazionano tra loro; da tutte quelle parole non deduce mai nulla sul mondo in fiore e in fermento. Non deduce che il succo d'uva sia una bevanda (anche se può trovare correlazioni di parole coerenti con quello); né inferisce nulla sulle norme sociali che potrebbero impedire alle persone di indossare costumi da bagno nei tribunali. Impara le correlazioni tra le parole e niente di più. Il sogno dell'empirista è acquisire una ricca comprensione del mondo dai dati sensoriali, ma GPT-3 non lo fa mai, nemmeno con mezzo terabyte di dati di input.

Mentre stavamo mettendo insieme questo saggio, il nostro collega Summers-Stay, che è bravo con le metafore, ha scritto a uno di noi, dicendo questo: 'GPT è strano perché non 'importa' di ottenere la risposta giusta a una tua domanda mettilo. È più come un attore di improvvisazione che è totalmente dedito al proprio mestiere, non rompe mai il personaggio e non è mai uscito di casa ma legge solo il mondo nei libri. Come un attore del genere, quando non sa qualcosa, fingerà semplicemente. Non ti fideresti di un attore di improvvisazione che interpreta un dottore per darti un consiglio medico.'

Inoltre, non dovresti fidarti di GPT-3 per darti consigli su come mescolare bevande o spostare mobili, per spiegare la trama di un romanzo a tuo figlio o per aiutarti a capire dove mettere il bucato; potrebbe risolvere il tuo problema di matematica, ma potrebbe non esserlo. È uno sproloquio fluente di cazzate, ma anche con 175 miliardi di parametri e 450 gigabyte di dati di input, non è un interprete affidabile del mondo.

Correzione: il suggerimento per l'esempio di ragionamento psicologico prevedeva una discussione tra Penny e Janet (non Penny e te, come originariamente affermato).

Gary Marcus è fondatore e CEO di Robusto.AI ed è stato fondatore e CEO di Geometric Intelligence, che è stata acquisita da Uber. È anche professore emerito alla New York University e autore di cinque libri tra cui Chitarra Zero e, con Ernest Da Visualizzazione , Riavvio dell'IA: costruire un'intelligenza artificiale di cui possiamo fidarci.

Ernest Davis è professore di informatica alla New York University. È autore di quattro libri, tra cui Rappresentazioni della conoscenza del buon senso.

nascondere