L'intelligenza artificiale di OpenAI sta imparando a generare immagini

Ben Barry / OpenAI





Nel febbraio dello scorso anno, il laboratorio di ricerca OpenAI con sede a San Francisco annunciato che il suo sistema di intelligenza artificiale ora potrebbe scrivere passaggi convincenti in inglese. Inserisci l'inizio di una frase o di un paragrafo in GPT-2, come veniva chiamato, e potrebbe continuare il pensiero per tutto il tempo di un saggio con una coerenza quasi umana.

Ora, il laboratorio sta esplorando cosa accadrebbe se lo stesso algoritmo fosse invece alimentato con parte di un'immagine. I risultati , a cui è stata assegnata una menzione d'onore per il miglior articolo alla Conferenza internazionale sull'apprendimento automatico di questa settimana, aprono una nuova strada per la generazione di immagini, ricca di opportunità e conseguenze.

Al suo interno, GPT-2 è un potente motore di previsione. Ha imparato a cogliere la struttura della lingua inglese guardando miliardi di esempi di parole, frasi e paragrafi, raschiati dagli angoli di Internet. Con quella struttura, potrebbe quindi manipolare le parole in nuove frasi prevedendo statisticamente l'ordine in cui dovrebbero apparire.



Quindi i ricercatori di OpenAI hanno deciso di scambiare le parole con pixel e addestrare lo stesso algoritmo sulle immagini in ImageNet, la banca di immagini più popolare per il deep learning. Poiché l'algoritmo è stato progettato per funzionare con dati unidimensionali (cioè stringhe di testo), hanno spiegato le immagini in un'unica sequenza di pixel. Hanno scoperto che il nuovo modello, chiamato iGPT, era ancora in grado di cogliere le strutture bidimensionali del mondo visivo. Data la sequenza di pixel per la prima metà di un'immagine, potrebbe prevedere la seconda metà in modi che un essere umano riterrebbe sensati.

Di seguito, puoi vedere alcuni esempi. La colonna più a sinistra è l'input, la colonna più a destra è l'originale e le colonne centrali sono i completamenti previsti di iGPT. (Vedi altri esempi qui .)

OPENAI

I risultati sono sorprendentemente impressionanti e dimostrano un nuovo percorso per l'utilizzo dell'apprendimento non supervisionato, che si allena su dati senza etichetta, nello sviluppo di sistemi di visione artificiale. Sebbene i primi sistemi di visione artificiale a metà degli anni 2000 avessero sperimentato tali tecniche in precedenza, sono caduti in disgrazia poiché l'apprendimento supervisionato, che utilizza dati etichettati, si è rivelato molto più efficace. Il vantaggio dell'apprendimento non supervisionato, tuttavia, è che consente a un sistema di intelligenza artificiale di conoscere il mondo senza un filtro umano e riduce significativamente il lavoro manuale di etichettatura dei dati.



Il fatto che iGPT utilizzi lo stesso algoritmo di GPT-2 mostra anche la sua promettente adattabilità. Questo è in linea con L'ambizione finale di OpenAI per ottenere un'intelligenza artificiale più generalizzabile.

Allo stesso tempo, il metodo presenta un nuovo modo preoccupante per creare immagini deepfake. Reti generative contraddittorie , la categoria più comune di algoritmi utilizzati per creare deepfake in passato, deve essere addestrata su dati altamente curati. Ad esempio, se desideri ottenere un GAN per generare un volto, i suoi dati di addestramento dovrebbero includere solo i volti. iGPT, al contrario, impara semplicemente abbastanza della struttura del mondo visivo attraverso milioni e miliardi di esempi per sputare immagini che potrebbero esistere fattibilmente al suo interno. Sebbene l'addestramento del modello sia ancora dispendioso dal punto di vista computazionale, offrendo una barriera naturale al suo accesso, potrebbe non durare a lungo.

OpenAI non ha concesso una richiesta di intervista, ma in una riunione del team politico interno a cui ha partecipato il MIT Technology Review l'anno scorso, il suo direttore politico, Jack Clark, ha riflettuto sui rischi futuri della generazione in stile GPT, incluso cosa accadrebbe se fosse applicato a immagini. Il video sta arrivando, ha detto, proiettando dove ha visto andare la traiettoria di ricerca del campo. Probabilmente tra cinque anni avrai una generazione di video condizionale su un orizzonte compreso tra cinque e dieci secondi.' Ha quindi proceduto a descrivere ciò che ha immaginato: avresti inserito la foto di un politico e un'esplosione accanto a loro, e ciò avrebbe generato un probabile risultato dell'uccisione di quel politico.



Aggiornare: Questo articolo è stato aggiornato per rimuovere il nome del politico nell'ipotetico scenario descritto alla fine.

nascondere