Questo algoritmo esplora Wikipedia per generare automaticamente libri di testo

Wikipedia





Apprendimento automatico: la guida completa è un tomo pesante. Con oltre 6.000 pagine, questo libro è un'introduzione completa all'apprendimento automatico, con capitoli aggiornati su reti neurali artificiali, algoritmi genetici e visione artificiale.

Ma questa non è una pubblicazione ordinaria. È un Wikibook, un libro di testo a cui chiunque può accedere o modificare, composto da articoli su Wikipedia, la vasta enciclopedia online.

Questa è una forza. Le informazioni di crowdsourcing sono costantemente aggiornate con tutti gli ultimi progressi e costantemente modificate per correggere errori e ambiguità.



Ma è anche una debolezza. Wikipedia è vasta. Decidere cosa includere in un libro di testo del genere è un compito difficile, motivo per cui forse il libro è così grande. Con più di 550 capitoli, non è una lettura leggera.

Ciò solleva una domanda interessante. Dati i progressi dell'intelligenza artificiale negli ultimi anni, c'è un modo per modificare automaticamente il contenuto di Wikipedia in modo da creare un insieme coerente che sia utile come libro di testo?

Entrano Shahar Admati e colleghi dell'Università Ben-Gurion del Negev in Israele. Questi ragazzi hanno sviluppato un modo per generare automaticamente Wikibook usando l'apprendimento automatico. Chiamano la loro macchina il Wikibook-bot. La novità della nostra tecnica è che mira a generare un intero Wikibook, senza coinvolgimento umano, dicono.



L'approccio è relativamente semplice. I ricercatori hanno iniziato identificando una serie di Wikibook esistenti che possono fungere da set di dati di addestramento. Hanno iniziato con 6.700 Wikibook inclusi in un set di dati messo a disposizione da Wikipedia per questo tipo di studio accademico.

Poiché questi Wikibook costituiscono una sorta di gold standard sia per la formazione che per i test, il team aveva bisogno di un modo per garantirne la qualità. Abbiamo scelto di concentrarci su Wikibook che sono stati visualizzati almeno 1000 volte, partendo dal presupposto che i Wikibook popolari siano di qualità ragionevole, dicono.

Ciò ha lasciato 490 Wikibook che hanno filtrato ulteriormente, in base a fattori come avere più di 10 capitoli. Ciò ha lasciato 407 Wikibook che il team ha utilizzato per addestrare le proprie macchine.



Il team ha quindi suddiviso il compito di creare un Wikibook in più parti, ognuna delle quali richiede una diversa abilità di apprendimento automatico. L'attività inizia con un titolo generato da un essere umano, che descrive un concetto di qualche tipo, come Apprendimento automatico: la guida completa .

Il primo compito è ordinare l'intero set di articoli di Wikipedia per determinare quali sono sufficientemente rilevanti da includere. Questo compito è impegnativo a causa dell'enorme volume di articoli che esistono in Wikipedia e della necessità di selezionare gli articoli più rilevanti tra milioni di articoli disponibili, affermano Admati e co.

Per aiutare in questo compito, il team ha utilizzato la struttura di rete di Wikipedia: gli articoli spesso puntano ad altri articoli che utilizzano collegamenti ipertestuali. È ragionevole presumere che l'articolo collegato possa essere pertinente.



Quindi hanno iniziato con un piccolo nucleo di articoli che menzionano il concetto di seme nel titolo. Hanno quindi identificato tutti gli articoli che sono fino a tre salti di distanza da questi semi sulla rete.

Ma quanti di questi articoli collegati dovrebbero essere inclusi? Per scoprirlo, hanno iniziato con i titoli dei 407 Wikibook creati da esseri umani ed hanno eseguito l'analisi a tre luppoli. Hanno quindi calcolato quanto del contenuto dei libri creati dall'uomo fosse incluso dall'approccio automatizzato.

Si scopre che l'approccio automatizzato spesso includeva gran parte del contenuto originale di Wikibook, ma molto di più. Quindi il team aveva bisogno di un altro modo per sfoltire ulteriormente il contenuto.

Anche in questo caso, entra in gioco la scienza delle reti. Ogni Wikibook generato dall'uomo ha una propria struttura di rete, determinata dal numero di collegamenti che puntano da altri articoli, dal numero di collegamenti che indicano, dall'elenco di page rank degli articoli inclusi e così via.

Quindi il team ha creato un algoritmo che ha esaminato ogni articolo selezionato automaticamente per un determinato argomento e quindi ha determinato se includerlo in un Wikibook renderebbe la struttura della rete più simile ai libri generati dall'uomo o meno. In caso contrario, l'articolo viene omesso.

Il passo successivo è organizzare gli articoli in capitoli. Questo è essenzialmente un compito di raggruppamento; guardare la rete formata dall'intera serie di articoli e capire come suddividerla in cluster coerenti. Per questo tipo di attività sono disponibili vari algoritmi di clustering.

Il passaggio finale consiste nel determinare l'ordine in cui gli articoli devono apparire in ogni capitolo. Per fare ciò, il team organizza gli articoli in coppia e utilizza un modello basato sulla rete per determinare quale dovrebbe apparire per primo. Ripetendo questo per tutte le combinazioni di coppie di articoli, l'algoritmo elabora un ordine preferito per gli articoli e quindi i capitoli.

In questo modo, il team è stato in grado di produrre versioni automatizzate di Wikibook che erano già state create dagli esseri umani. Quanto bene questi libri automatizzati si confrontino con quelli generati dall'uomo è difficile da giudicare. Contengono certamente molto dello stesso materiale, spesso in un ordine simile, il che è un buon inizio.

Ma Adamti e compagni hanno un piano per determinare l'utilità del loro approccio. Hanno in programma di produrre una serie di Wikibook su argomenti non ancora trattati dai libri generati dall'uomo. Monitoreranno quindi le visualizzazioni di pagina e le modifiche a questi libri per vedere quanto diventano popolari e quanto pesantemente vengono modificati, rispetto ai libri generati dall'uomo. Questo sarà un test del mondo reale per il nostro approccio, dicono.

È un lavoro interessante che ha il potenziale per produrre libri di testo preziosi su un'ampia gamma di argomenti e persino per creare altri testi come atti di conferenze. Quanto saranno preziosi per i lettori umani è ancora da determinare. Ma staremo a guardare per scoprirlo.

Rif: arxiv.org/abs/1812.10937 : Wikibook-Bot—Generazione automatica di un libro di Wikipedia

nascondere