Il campo dell'elaborazione del linguaggio naturale sta inseguendo l'obiettivo sbagliato

erba cicloptica lampeggiante

Signora Tech | Spruzza





In una tipica riunione annuale del Associazione per la linguistica computazionale (ACL), il programma è una carrellata di titoli come Un codificatore automatico variazionale strutturato per l'inflessione morfologica contestuale. Lo stesso sapore tecnico permea i giornali, i colloqui di ricerca e molte conversazioni in corridoio.

A quest'anno conferenza a luglio, però, qualcosa sembrava diverso e non era solo il formato virtuale. Le conversazioni dei partecipanti sono state insolitamente introspettive sui metodi e gli obiettivi principali dell'elaborazione del linguaggio naturale (PNL), il ramo dell'IA incentrato sulla creazione di sistemi che analizzano o generano il linguaggio umano. Documenti nel nuovo di quest'anno Traccia a tema ha posto domande come: I metodi attuali veramente abbastanza raggiungere gli obiettivi finali del campo? Che cosa anche questi obiettivi?

Io e i miei colleghi a Cognizione Elementale , una società di ricerca sull'intelligenza artificiale con sede in Connecticut e New York, considera l'angoscia giustificata. Riteniamo infatti che il settore abbia bisogno di una trasformazione, non solo nella progettazione del sistema, ma in un ambito meno glamour: la valutazione.



L'attuale zeitgeist della PNL è nato da mezzo decennio di costanti miglioramenti nell'ambito del paradigma di valutazione standard. La capacità di comprensione dei sistemi è stata generalmente misurata set di dati di riferimento composto da migliaia di domande, ciascuna accompagnata da brani contenenti la risposta. Quando le reti neurali profonde hanno spazzato il campo a metà degli anni 2010, hanno portato un salto di qualità nelle prestazioni. I successivi cicli di lavoro hanno mantenuto i punteggi sempre più vicini al 100% (o almeno alla parità con gli esseri umani).

Quindi i ricercatori pubblicherebbero nuovi set di dati di Anche più complicato domande , solo per vedere reti neurali ancora più grandi pubblicare rapidamente punteggi impressionanti. Gran parte della ricerca sulla comprensione della lettura di oggi comporta un'attenta modifica dei modelli per ottenere qualche punto percentuale in più sugli ultimi set di dati. Lo stato dell'arte è praticamente diventato un nome proprio: Abbiamo battuto SOTA Squadra di 2,4 punti!

Ma molti persone in il campo sono sempre più stanchi di una simile ricerca in classifica. Cosa ha davvero guadagnato il mondo se un'enorme rete neurale raggiunge SOTA su un benchmark di un punto o due? Non è che a qualcuno importi di rispondere a queste domande per il proprio bene; vincere la classifica è un esercizio accademico che potrebbe non migliorare gli strumenti del mondo reale. In effetti, molti apparenti miglioramenti emergono non dalle capacità di comprensione generale, ma dalla straordinaria abilità dei modelli sfruttando spurio modelli nei dati. I recenti progressi si traducono davvero nell'aiutare le persone a risolvere i problemi?



Tali dubbi sono qualcosa di più di un'astratta agitazione; se i sistemi sono veramente competenti nella comprensione della lingua ha una vera posta in gioco per la società. Naturalmente, la comprensione implica un'ampia raccolta di abilità. Per applicazioni più semplici, come il recupero dei factoid di Wikipedia o la valutazione del sentimento nelle recensioni dei prodotti, metodi moderni fare abbastanza bene . Ma quando le persone immaginano computer che comprendono il linguaggio, immaginano comportamenti molto più sofisticati: strumenti legali che aiutano le persone ad analizzare le loro difficoltà; assistenti di ricerca che sintetizzano informazioni da tutto il web; robot o personaggi di gioco che eseguono istruzioni dettagliate.

I modelli odierni non sono neanche lontanamente vicini al raggiungimento di quel livello di comprensione e non è chiaro se l'ennesimo documento SOTA avvicinerà ulteriormente il campo.

Come ha fatto la comunità della PNL a ritrovarsi con un tale divario tra le valutazioni su carta e le capacità del mondo reale? In un ACL documento di sintesi , i miei colleghi e io sosteniamo che nella ricerca per raggiungere benchmark difficili, le valutazioni hanno perso di vista i veri obiettivi: quelle sofisticate applicazioni a valle. Per prendere in prestito una frase dal documento, i ricercatori della PNL si sono allenati per diventare velocisti professionisti dando un'occhiata in giro per la palestra e adottando tutti gli esercizi che sembrano difficili.



Per portare le valutazioni più in linea con gli obiettivi, aiuta a considerare cosa trattiene i sistemi odierni.

Una lettura umana di un passaggio costruirà una rappresentazione dettagliata di entità, luoghi, eventi e le loro relazioni, un modello mentale del mondo descritto nel testo. Il lettore può quindi inserire i dettagli mancanti nel modello, estrapolare una scena avanti o indietro, o anche ipotizzare alternative controfattuali.

Questo tipo di modellazione e ragionamento è esattamente ciò che devono fare gli assistenti di ricerca automatizzati o i personaggi dei giochi, ed è evidentemente assente dai sistemi odierni. Un ricercatore di PNL di solito può bloccare un sistema di comprensione della lettura all'avanguardia in pochi tentativi. Uno tecnica affidabile è sondare il modello del mondo del sistema, che può lasciare anche il tanto spavaldo GPT-3 balbettio sui fili d'erba ciclottici.



L'integrazione di lettori automatizzati con modelli mondiali richiederà importanti innovazioni nella progettazione del sistema, come discusso in parecchi Traccia tematica sottomissioni . Ma la nostra argomentazione è più basilare: comunque i sistemi siano implementati, se hanno bisogno di avere modelli del mondo fedeli, allora le valutazioni dovrebbero verificare sistematicamente se hanno modelli del mondo fedeli.

Detto così chiaramente, può sembrare ovvio, ma raramente lo si fa. Gruppi di ricerca come il Istituto Allen per l'IA avere proposto altri modi per rafforzare le valutazioni, come prendere di mira diverse strutture linguistiche, porre domande che si basano su più passaggi di ragionamento o anche solo aggregando molti punti di riferimenti . Altri ricercatori, come Yejin Choi del gruppo dell'Università di Washington, si sono concentrati sui test Comune senso , che richiama aspetti di un modello mondiale. Tali sforzi sono utili, ma generalmente si concentrano ancora sulla compilazione di domande a cui i sistemi odierni faticano a rispondere.

Proponiamo un cambiamento più fondamentale: per costruire valutazioni più significative, i ricercatori della PNL dovrebbero iniziare specificando a fondo cosa dovrebbe contenere il modello mondiale di un sistema per essere utile per le applicazioni a valle. Chiamiamo tale resoconto un modello di comprensione.

Un banco di prova particolarmente promettente per questo approccio sono le storie di fantasia. Le storie originali sono ricche di informazioni, non utilizzabili su Google e centrali per molte applicazioni, il che le rende un test ideale per le capacità di comprensione della lettura. Attingendo alla letteratura di scienze cognitive sui lettori umani, il nostro CEO David Ferrucci ha proposto un modello in quattro parti per testare la capacità di un sistema di intelligenza artificiale di comprendere le storie.

  • Spaziale: Dove si trova tutto e come è posizionato nel corso della storia?
  • Temporaneo: Quali eventi si verificano e quando?
  • Causale: In che modo gli eventi conducono meccanicamente ad altri eventi?
  • motivazionale: Perché i personaggi decidono di intraprendere le azioni che intraprendono?

Ponendo sistematicamente queste domande su tutte le entità e gli eventi in una storia, i ricercatori della PNL possono valutare la comprensione dei sistemi in base ai principi, sondando i modelli mondiali di cui i sistemi hanno effettivamente bisogno.

È incoraggiante vedere la comunità della PNL riflettere su ciò che manca alle tecnologie odierne. Ci auguriamo che questo pensiero porti a investimenti sostanziali non solo in nuovi algoritmi, ma in modi nuovi e più rigorosi di comprensione delle macchine di misura. Tale lavoro potrebbe non fare così tanti titoli, ma sospettiamo che gli investimenti in quest'area faranno avanzare il campo almeno quanto il prossimo modello gigantesco.

Jesse Dunietz è ricercatore presso Cognizione Elementale , dove lavora allo sviluppo di valutazioni rigorose per i sistemi di comprensione della lettura. È anche un designer educativo per il MIT Laboratorio di comunicazione e un scrittore di scienze .

nascondere