Come l'apprendimento automatico malevolo potrebbe far deragliare l'IA

Jeremy Portje





L'intelligenza artificiale non rivoluzionerà nulla se gli hacker possono pasticciare con essa.

Questo è l'avvertimento di Canzone dell'alba , professore alla UC Berkeley specializzato nello studio dei rischi per la sicurezza legati all'IA e all'apprendimento automatico.

Parlando a EmTech Digital, un evento a San Francisco prodotto da MIT Technology Review, Song ha avvertito che le nuove tecniche per sondare e manipolare i sistemi di apprendimento automatico, noti nel campo come metodi di apprendimento automatico contraddittorio, potrebbero causare grossi problemi a chiunque cerchi di sfruttare il potenza dell'IA negli affari.

Song ha affermato che l'apprendimento automatico contraddittorio potrebbe essere utilizzato per attaccare quasi tutti i sistemi basati sulla tecnologia.

È un grosso problema, ha detto al pubblico. Dobbiamo unirci per risolverlo.

L'apprendimento automatico contraddittorio implica l'immissione sperimentale di input in un algoritmo per rivelare le informazioni su cui è stato addestrato o la distorsione dell'input in modo da causare un comportamento anomalo del sistema. Inserendo molte immagini in un algoritmo di visione artificiale, ad esempio, è possibile decodificare il suo funzionamento e garantire determinati tipi di output, compresi quelli errati.

Song ha presentato diversi esempi di inganni di apprendimento contraddittorio che il suo gruppo di ricerca ha esplorato.

Un progetto, condotto in collaborazione con Google, ha riguardato il sondaggio di algoritmi di machine learning addestrati per generare risposte automatiche dai messaggi di posta elettronica (in questo caso il Set di dati di posta elettronica Enron ). Lo sforzo ha dimostrato che, creando i messaggi giusti, è possibile fare in modo che il modello della macchina emetta dati sensibili come i numeri di carta di credito. I risultati sono stati utilizzati da Google per impedire lo sfruttamento di Smart Compose, lo strumento che genera automaticamente il testo in Gmail.

Un altro progetto prevedeva la modifica della segnaletica stradale con alcuni adesivi dall'aspetto innocuo per ingannare i sistemi di visione artificiale utilizzati in molti veicoli. In un video demo, Song ha mostrato come l'auto potrebbe essere indotta a pensare che un segnale di stop indichi effettivamente che il limite di velocità è di 45 miglia orarie. Questo potrebbe essere un grosso problema per un sistema di guida automatizzato che si basa su tali informazioni.

Il machine learning contraddittorio è un'area di crescente interesse per i ricercatori di machine learning. Negli ultimi due anni, altri gruppi di ricerca hanno mostrato come le API di apprendimento automatico online possono essere sondate e sfruttate per escogitare modi per ingannarli o per rivelare informazioni sensibili.

Non sorprende che l'apprendimento automatico contraddittorio sia di enorme interesse anche per la comunità della difesa. Con un numero crescente di sistemi militari, inclusi sensori e sistemi di armi, che sfruttano l'apprendimento automatico, esiste un enorme potenziale per queste tecniche da utilizzare sia in difesa che in attacco.

Quest'anno, il braccio di ricerca del Pentagono, DARPA, ha lanciato un importante progetto chiamato Guaranteeing AI Robustness against Deception (GARD), volto allo studio dell'apprendimento automatico contraddittorio. Hava Siegelman , direttore del programma GARD, ha dichiarato di recente al MIT Technology Review che l'obiettivo di questo progetto era sviluppare modelli di intelligenza artificiale robusti di fronte a un'ampia gamma di attacchi contraddittori, piuttosto che semplicemente in grado di difendersi da quelli specifici.

nascondere