211service.com
Questi inquietanti falsi umani annunciano una nuova era nell'IA
Per gentile concessione di Datagen
Puoi vedere la debole barba ispida che arriva sul suo labbro superiore, le rughe sulla sua fronte, le macchie sulla sua pelle. Non è una persona reale, ma ha lo scopo di imitarne una, così come le centinaia di migliaia di altri prodotti da Datagen, un'azienda che vende esseri umani falsi e simulati.
Questi umani non sono avatar di gioco o personaggi animati per i film. Sono dati sintetici progettati per alimentare il crescente appetito degli algoritmi di deep learning. Aziende come Datagen offrono un'alternativa irresistibile al costoso e lungo processo di raccolta dei dati del mondo reale. Lo faranno per te: come lo vuoi, quando vuoi e relativamente a buon mercato.
Per generare i suoi umani sintetici, Datagen prima scansiona gli esseri umani reali. Collabora con fornitori che pagano persone per entrare all'interno di giganteschi scanner per tutto il corpo che catturano ogni dettaglio dalle loro iridi alla struttura della pelle fino alla curvatura delle dita. La startup prende quindi i dati grezzi e li pompa attraverso una serie di algoritmi, che sviluppano rappresentazioni 3D del corpo, del viso, degli occhi e delle mani di una persona.
L'azienda, che ha sede in Israele, afferma di lavorare già con quattro dei principali colossi tecnologici statunitensi, anche se non rivelerà quali siano quelli registrati. Il suo concorrente più vicino, Sintesi AI , offre anche esseri umani digitali su richiesta. Altre aziende generano dati da utilizzare finanza , assicurazione , e assistenza sanitaria . Ce ne sono circa altrettanti società di dati sintetici poiché esistono tipi di dati.
Una volta considerati meno desiderabili dei dati reali, i dati sintetici sono ora visti da alcuni come una panacea. I dati reali sono disordinati e pieni di pregiudizi. Le nuove normative sulla privacy dei dati rendono difficile la raccolta. Al contrario, i dati sintetici sono incontaminati e possono essere utilizzati per creare set di dati più diversificati. Puoi produrre volti perfettamente etichettati, ad esempio, di età, forme ed etnie diverse per costruire un sistema di rilevamento dei volti che funzioni tra le popolazioni.
Ma i dati sintetici hanno i suoi limiti. Se non riesce a riflettere la realtà, potrebbe finire per produrre un'IA ancora peggiore dei dati disordinati e distorti del mondo reale, o potrebbe semplicemente ereditare gli stessi problemi. Quello che non voglio fare è dare il pollice in alto a questo paradigma e dire: 'Oh, questo risolverà così tanti problemi', afferma Cathy O'Neil, una scienziata di dati e fondatrice della società di revisione algoritmica ORCAA. Perché ignorerà anche molte cose.
Realistico, non reale
Il deep learning ha sempre riguardato i dati. Ma negli ultimi anni, la comunità dell'IA lo ha imparato Buono i dati sono più importanti di grande dati . Anche piccole quantità di dati corretti ed etichettati in modo pulito possono fare di più per migliorare le prestazioni di un sistema di intelligenza artificiale di 10 volte la quantità di dati non curati, o anche un algoritmo più avanzato.
Ciò cambia il modo in cui le aziende dovrebbero affrontare lo sviluppo dei loro modelli di intelligenza artificiale, afferma Ofir Chakon, CEO e cofondatore di Datagen. Oggi iniziano acquisendo quanti più dati possibili, quindi modificano e ottimizzano i loro algoritmi per prestazioni migliori. Invece, dovrebbero fare il contrario: usare lo stesso algoritmo migliorando la composizione dei loro dati.

Datagen genera anche mobili e ambienti interni falsi per contestualizzare i suoi falsi umani.
DATAGEN
Ma la raccolta di dati del mondo reale per eseguire questo tipo di sperimentazione iterativa è troppo costosa e richiede molto tempo. È qui che entra in gioco Datagen. Con un generatore di dati sintetici, i team possono creare e testare dozzine di nuovi set di dati al giorno per identificare quale massimizza le prestazioni di un modello.
Per garantire il realismo dei suoi dati, Datagen fornisce ai suoi fornitori istruzioni dettagliate su quante persone scansionare in ciascuna fascia di età, intervallo di BMI ed etnia, nonché un elenco prestabilito di azioni da eseguire, come camminare in una stanza o bere una bibita. I fornitori restituiscono sia immagini statiche ad alta fedeltà che dati di acquisizione del movimento di tali azioni. Gli algoritmi di Datagen espandono quindi questi dati in centinaia di migliaia di combinazioni. I dati sintetizzati a volte vengono quindi ricontrollati. I volti falsi vengono tracciati su volti reali, ad esempio, per vedere se sembrano realistici.
Datagen sta ora generando espressioni facciali per monitorare l'attenzione del conducente nelle auto intelligenti, i movimenti del corpo per tracciare i clienti nei negozi senza cassiere e le iridi e i movimenti delle mani per migliorare le capacità di tracciamento degli occhi e delle mani dei visori VR. La società afferma che i suoi dati sono già stati utilizzati per sviluppare sistemi di visione artificiale al servizio di decine di milioni di utenti.
Non sono solo gli esseri umani sintetici a essere prodotti in serie. Click-in è una startup che utilizza l'IA sintetica per eseguire ispezioni automatiche dei veicoli. Utilizzando un software di progettazione, ricrea tutte le marche e i modelli di auto che la sua intelligenza artificiale ha bisogno di riconoscere e quindi li rende con colori, danni e deformazioni diversi in diverse condizioni di illuminazione, su sfondi diversi. Ciò consente all'azienda di aggiornare la sua intelligenza artificiale quando le case automobilistiche pubblicano nuovi modelli e aiuta a evitare violazioni della privacy dei dati nei paesi in cui le targhe sono considerate informazioni private e quindi non possono essere presenti nelle foto utilizzate per addestrare l'IA.

Click-Ins esegue il rendering di auto di diverse marche e modelli su diversi sfondi.
CLICK-INPrincipalmente.ai collabora con società finanziarie, di telecomunicazioni e assicurative per fornire fogli di calcolo di dati falsi dei clienti che consentono alle aziende di condividere il database dei clienti con fornitori esterni in modo legalmente conforme. L'anonimizzazione può ridurre la ricchezza di un set di dati ma non riesce comunque a proteggere adeguatamente la privacy delle persone. Ma i dati sintetici possono essere utilizzati per generare set di dati falsi dettagliati che condividono le stesse proprietà statistiche dei dati reali di un'azienda. Può anche essere utilizzato per simulare dati di cui l'azienda non dispone ancora, inclusa una popolazione di clienti più diversificata o scenari come attività fraudolente.
I sostenitori dei dati sintetici affermano che possono aiutare anche a valutare l'IA. In un documento recente pubblicato in una conferenza sull'intelligenza artificiale, Suchi Saria, professore associato di apprendimento automatico e assistenza sanitaria presso la Johns Hopkins University, e i suoi coautori hanno dimostrato come le tecniche di generazione dei dati potrebbero essere utilizzate per estrapolare diverse popolazioni di pazienti da un unico insieme di dati. Ciò potrebbe essere utile se, ad esempio, un'azienda disponesse solo dei dati della popolazione più giovane di New York City, ma volesse capire come si comporta la sua IA su una popolazione che invecchia con una maggiore prevalenza di diabete. Ora sta avviando la sua società, Bayesian Health, che utilizzerà questa tecnica per testare i sistemi di IA medica.
I limiti del fingere
Ma i dati sintetici sono sovrastimati?
Quando si tratta di privacy, solo perché i dati sono 'sintetici' e non corrispondono direttamente ai dati dell'utente reale non significa che non codifichino informazioni sensibili su persone reali, afferma Aaron Roth, professore di informatica e scienze dell'informazione presso il Università della Pennsylvania. È stato dimostrato che alcune tecniche di generazione dei dati riproducono fedelmente le immagini o il testo che si trovano nei dati di addestramento, ad esempio, mentre altre sono vulnerabili agli attacchi che le fanno rigurgitare completamente quei dati.
Questo potrebbe andare bene per un'azienda come Datagen, i cui dati sintetici non hanno lo scopo di nascondere l'identità delle persone che hanno acconsentito alla scansione. Ma sarebbe una cattiva notizia per le aziende che offrono la loro soluzione come un modo per proteggere informazioni finanziarie o pazienti sensibili.
Storia correlata
L'anno in cui i deepfake sono diventati mainstream Nel 2020, i media sintetici di intelligenza artificiale hanno iniziato ad allontanarsi dagli angoli più bui di Internet.La ricerca suggerisce che la combinazione di due tecniche di dati sintetici in particolare: privacy differenziale e reti contraddittorie generative —può produrre le più forti protezioni della privacy, afferma Bernease Herman, uno scienziato di dati presso l'Università di Washington eScience Institute. Ma gli scettici temono che questa sfumatura possa essere persa nel gergo di marketing dei fornitori di dati sintetici, che non sarà sempre esplicito sulle tecniche che stanno utilizzando.
Nel frattempo, poche prove suggeriscono che i dati sintetici possono mitigare efficacemente la distorsione dei sistemi di intelligenza artificiale. Per prima cosa, l'estrapolazione di nuovi dati da un set di dati esistente che è distorto non produce necessariamente dati più rappresentativi. I dati grezzi di Datagen, ad esempio, contengono proporzionalmente meno minoranze etniche, il che significa che utilizza meno punti dati reali per generare falsi umani da quei gruppi. Sebbene il processo di generazione non sia del tutto congetturale, è più probabile che quei falsi umani si discostino dalla realtà. Se i tuoi volti dalla tonalità della pelle più scura non sono un'approssimazione particolarmente buona dei volti, allora non stai effettivamente risolvendo il problema, afferma O'Neil.
Inoltre, i set di dati perfettamente bilanciati non si traducono automaticamente in sistemi di intelligenza artificiale perfettamente equi, afferma Christo Wilson, professore associato di informatica alla Northeastern University. Se un prestatore di carte di credito stesse cercando di sviluppare un algoritmo di intelligenza artificiale per il punteggio di potenziali mutuatari, non eliminerebbe tutte le possibili discriminazioni semplicemente rappresentando i bianchi e i neri nei suoi dati. La discriminazione potrebbe ancora insinuarsi a causa delle differenze tra i candidati bianchi e neri.
A complicare ulteriormente le cose, le prime ricerche mostrano che in alcuni casi potrebbe non essere nemmeno possibile ottenere entrambi i privati e IA equa con dati sintetici. In un documento recente pubblicato in una conferenza sull'intelligenza artificiale, i ricercatori dell'Università di Toronto e del Vector Institute hanno provato a farlo con i raggi X del torace. Hanno scoperto di non essere in grado di creare un accurato sistema di intelligenza artificiale medica quando hanno cercato di creare un set di dati sintetici diversificato attraverso la combinazione di privacy differenziale e reti contraddittorie generative.
Niente di tutto ciò significa che i dati sintetici non dovrebbero essere utilizzati. In effetti, potrebbe diventare una necessità. Poiché le autorità di regolamentazione devono affrontare la necessità di testare i sistemi di intelligenza artificiale per la conformità legale, potrebbe essere l'unico approccio che offre loro la flessibilità di cui hanno bisogno per generare dati di test mirati su richiesta, afferma O'Neil. Ma questo rende le domande sui suoi limiti ancora più importanti da studiare e rispondere ora.
È probabile che i dati sintetici migliorino nel tempo, dice, ma non per caso.