Questa intelligenza artificiale impara leggendo l'intero Web ininterrottamente

illustrazione del grafico della conoscenza

La signora Tech





A luglio, OpenAI's ultimo modello linguistico, GPT-3 , abbagliato dalla sua capacità di sfornare paragrafi che sembrano essere stati scritti da un essere umano. Le persone hanno iniziato a mostrare come GPT-3 potesse anche completare automaticamente il codice o riempire gli spazi vuoti nei fogli di calcolo.

In un esempio, il dipendente di Twitter Paul Katsen ha twittato la funzione del foglio di calcolo per governarli tutti, in cui GPT-3 riempie le colonne di per sé, raccogliendo i dati per gli stati degli Stati Uniti: la popolazione del Michigan è di 10,3 milioni, l'Alaska divenne uno stato nel 1906 e così via.

Tranne che GPT-3 può essere un po' una cazzata. La popolazione del Michigan non è mai stata di 10,3 milioni e l'Alaska è diventata uno stato nel 1959.



I modelli linguistici come GPT-3 sono imitazioni incredibili , ma hanno poco senso di ciò che stanno effettivamente dicendo. Sono davvero bravi a generare storie sugli unicorni, afferma Mike Tung, CEO della startup Diffbot di Stanford. Ma non sono addestrati per essere reali.

Questo è un problema se vogliamo che le IA siano affidabili. Ecco perché Diffbot adotta un approccio diverso. Sta costruendo un'intelligenza artificiale che legge ogni pagina dell'intero Web pubblico, in più lingue, ed estrae quanti più fatti possibile da quelle pagine.

Come GPT-3, il sistema di Diffbot impara aspirando grandi quantità di testo scritto da umani trovato online. Ma invece di utilizzare quei dati per addestrare un modello linguistico, Diffbot trasforma ciò che legge in una serie di factoid in tre parti che mettono in relazione una cosa con un'altra: soggetto, verbo, oggetto.



Indicato la mia biografia, ad esempio, Diffbot scopre che Will Douglas Heaven è un giornalista; Will Douglas Heaven lavora al MIT Technology Review; MIT Technology Review è una società di media; e così via. Ognuno di questi factoidi si unisce a miliardi di altri in una rete tentacolare e interconnessa di fatti. Questo è noto come grafico della conoscenza.

I grafici della conoscenza non sono nuovi. Esistono da decenni ed erano un concetto fondamentale nella prima ricerca sull'IA. Ma la costruzione e il mantenimento dei grafici della conoscenza è stato in genere fatto a mano, il che è difficile. Ciò ha anche impedito a Tim Berners-Lee di realizzare quello che ha chiamato il web semantico, che avrebbe incluso informazioni per le macchine oltre che per gli esseri umani, in modo che i robot potessero prenotare i nostri voli, fare la spesa o dare risposte più intelligenti alle domande rispetto ai motori di ricerca.

Alcuni anni fa, Google ha iniziato a utilizzare anche i grafici della conoscenza. Cerca Katy Perry e otterrai una casella accanto ai risultati della ricerca principale che ti dice che Katy Perry è una cantautrice americana con musica disponibile su YouTube, Spotify e Deezer. Puoi vedere a colpo d'occhio che è sposata con Orlando Bloom, ha 35 anni e vale 125 milioni di dollari, e così via. Invece di darti un elenco di collegamenti a pagine su Katy Perry, Google ti fornisce una serie di fatti su di lei tratti dal suo grafico della conoscenza.



Ma Google lo fa solo per i suoi termini di ricerca più popolari. Diffbot vuole farlo per tutto. Automatizzando completamente il processo di costruzione, Diffbot è stato in grado di costruire quello che potrebbe essere il più grande grafico della conoscenza di sempre.

Insieme a Google e Microsoft, è una delle sole tre società statunitensi che effettuano la scansione dell'intero Web pubblico. Ha decisamente senso eseguire la scansione del Web, afferma Victoria Lin, ricercatrice presso Salesforce che lavora sull'elaborazione del linguaggio naturale e sulla rappresentazione della conoscenza. In caso contrario, molti sforzi umani potrebbero essere necessari per creare una vasta base di conoscenze. Heiko Paulheim dell'Università di Mannheim in Germania concorda: l'automazione è l'unico modo per costruire grafici della conoscenza su larga scala.

Super surfista

Per raccogliere i suoi fatti, l'IA di Diffbot legge il Web come farebbe un essere umano, ma molto più velocemente. Utilizzando una versione potenziata del browser Chrome, l'IA visualizza i pixel grezzi di una pagina Web e utilizza algoritmi di riconoscimento delle immagini per classificare la pagina come uno dei 20 diversi tipi, inclusi video, immagini, articoli, eventi e discussioni . Identifica quindi gli elementi chiave della pagina, come titolo, autore, descrizione del prodotto o prezzo, e utilizza la NLP per estrarre fatti da qualsiasi testo.



Ogni fattoide in tre parti viene aggiunto al grafico della conoscenza. Diffbot estrae fatti da pagine scritte in qualsiasi lingua, il che significa che può rispondere a domande su Katy Perry, ad esempio, utilizzando fatti tratti da articoli in cinese o arabo anche se non contengono il termine Katy Perry.

Navigare sul Web come un essere umano consente all'IA di vedere gli stessi fatti che vediamo noi. Significa anche che ha dovuto imparare a navigare sul web come noi. L'IA deve scorrere verso il basso, passare da una scheda all'altra e fare clic sui popup. L'IA deve giocare sul Web come un videogioco solo per sperimentare le pagine, afferma Tung.

Diffbot esegue la scansione del Web senza interruzioni e ricostruisce il suo grafico della conoscenza ogni quattro o cinque giorni. Secondo Tung, l'IA aggiunge da 100 milioni a 150 milioni di entità ogni mese man mano che nuove persone compaiono online, vengono create aziende e lanciati prodotti. Utilizza più algoritmi di apprendimento automatico per fondere nuovi fatti con quelli vecchi, creando nuove connessioni o sovrascrivendo quelle scadute. Diffbot deve aggiungere nuovo hardware al suo data center man mano che il grafico della conoscenza cresce.

I ricercatori possono accedere gratuitamente al grafico della conoscenza di Diffbot. Ma Diffbot ha anche circa 400 clienti paganti. Il motore di ricerca DuckDuckGo lo utilizza per generare le proprie caselle simili a Google. Snapchat lo usa per estrarre i punti salienti dalle pagine delle notizie. La popolare app di wedding planner Zola la usa per aiutare le persone a creare liste di nozze, inserendo immagini e prezzi. Il NASDAQ, che fornisce informazioni sul mercato azionario, lo utilizza per la ricerca finanziaria.

Scarpe finte

Adidas e Nike lo usano persino per cercare sul web scarpe contraffatte. Un motore di ricerca restituirà un lungo elenco di siti che menzionano le scarpe da ginnastica Nike. Ma Diffbot consente a queste aziende di cercare siti che vendono effettivamente le loro scarpe, piuttosto che parlarne.

Per ora, queste aziende devono interagire con Diffbot utilizzando il codice. Ma Tung prevede di aggiungere un'interfaccia in linguaggio naturale. In definitiva, vuole costruire quello che chiama un sistema universale di risposta alle domande factoid: un'intelligenza artificiale in grado di rispondere a quasi tutto ciò che gli viene chiesto, con fonti a sostegno della sua risposta.

Tung e Lin concordano sul fatto che questo tipo di IA non può essere costruito solo con modelli linguistici. Ma meglio ancora sarebbe combinare le tecnologie, utilizzando un modello linguistico come GPT-3 per creare un front-end simile a quello umano per un bot sapientone.

Tuttavia, anche un'IA che ha i suoi fatti chiari non è necessariamente intelligente. Non stiamo cercando di definire cosa sia l'intelligenza, o qualcosa del genere, dice Tung. Stiamo solo cercando di costruire qualcosa di utile.

nascondere