I doppiatori dell'IA sembrano più umani che mai e sono pronti per essere assunti

Concetto di attore voiceover AI

Signora Tech | Getty





Il post sul blog dell'azienda gocciola con l'entusiasmo di uno spot pubblicitario statunitense degli anni '90. WellSaid Labs descrive cosa possono aspettarsi i clienti dai suoi otto nuovi doppiatori digitali! Tobin è energico e perspicace. Paige è equilibrata ed espressiva. Ava è raffinata, sicura di sé e professionale.

Ognuno si basa su un vero doppiatore, la cui somiglianza (con consenso) è stata preservata utilizzando l'IA. Le aziende possono ora concedere in licenza a queste voci di dire tutto ciò di cui hanno bisogno. Introducono semplicemente del testo nel motore vocale e l'uscita trasmetterà una clip audio nitida di una performance dal suono naturale.

WellSaid Labs , una startup con sede a Seattle nata dalla ricerca senza scopo di lucro Allen Institute of Artificial Intelligence, è l'ultima azienda che offre voci AI ai clienti. Per ora, è specializzato in voci per video di e-learning aziendali. Altre startup danno voce a assistenti digitali , operatori di call center , e persino personaggi dei videogiochi .



KH · Un doppiatore WellSaid AI in uno stile promozionale

Non molto tempo fa, voci così false avevano una pessima reputazione per il loro uso chiamate truffa e inganno di internet . Ma da allora il loro miglioramento della qualità ha suscitato l'interesse di un numero crescente di aziende. I recenti progressi nell'apprendimento profondo hanno permesso di replicare molte delle sottigliezze del linguaggio umano. Queste voci si fermano e respirano nei posti giusti. Possono cambiare il loro stile o le loro emozioni. Puoi individuare il trucco se parlano troppo a lungo, ma in brevi clip audio, alcuni sono diventati indistinguibili dagli umani.

Le voci AI sono anche economiche, scalabili e facili da usare. A differenza di una registrazione di un doppiatore umano, le voci sintetiche possono anche aggiornare la loro sceneggiatura in tempo reale, aprendo nuove opportunità per personalizzare la pubblicità.

Ma l'ascesa delle voci false iperrealistiche non è priva di conseguenze. I doppiatori umani, in particolare, sono stati lasciati a chiedersi cosa significhi per i loro mezzi di sussistenza.



Come fingere una voce

Le voci sintetiche sono in circolazione da un po'. Ma quelli vecchi, comprese le voci dell'originale Siria e Alessia , semplicemente incollando insieme parole e suoni per ottenere un effetto goffo e robotico. Farli suonare in modo più naturale è stata un'attività manuale laboriosa.

L'apprendimento profondo lo ha cambiato. Gli sviluppatori vocali non avevano più bisogno di dettare il ritmo, la pronuncia o l'intonazione esatti del parlato generato. Invece, potrebbero inserire alcune ore di audio in un algoritmo e fare in modo che l'algoritmo impari quei modelli da solo.

Se sono Pizza Hut, non posso certo suonare come quello di Domino, e di certo non posso suonare come quello di Papa John.



Rupal Patel, fondatore e CEO di VocaliD

Nel corso degli anni, i ricercatori hanno utilizzato questa idea di base per costruire motori vocali sempre più sofisticati. Quello costruito da WellSaid Labs, ad esempio, utilizza due modelli di deep learning primari. Il primo prevede, da un passaggio di testo, i tratti ampi di come suonerà un oratore, inclusi accento, tono e timbro. Il secondo riempie i dettagli, compresi i respiri e il modo in cui la voce risuona nel suo ambiente.

Tuttavia, creare una voce sintetica convincente richiede più della semplice pressione di un pulsante. Parte di ciò che rende una voce umana così umana è la sua incoerenza, espressività e capacità di fornire le stesse battute in stili completamente diversi, a seconda del contesto.

Catturare queste sfumature implica trovare i doppiatori giusti per fornire i dati di formazione appropriati e mettere a punto i modelli di deep learning. WellSaid afferma che il processo richiede almeno un'ora o due di audio e alcune settimane di lavoro per sviluppare una replica sintetica dal suono realistico.



KH · Un agente del servizio clienti Resemble.ai KH · Un doppiatore di Resemble.ai in stile colloquiale

Le voci AI sono diventate particolarmente popolari tra i marchi che cercano di mantenere un suono coerente in milioni di interazioni con i clienti. Con l'ubiquità degli altoparlanti intelligenti oggi e l'ascesa degli agenti di servizio clienti automatizzati e degli assistenti digitali integrati nelle automobili e nei dispositivi intelligenti, i marchi potrebbero dover produrre fino a cento ore di audio al mese. Ma non vogliono nemmeno più utilizzare le voci generiche offerte dalla tradizionale tecnologia di sintesi vocale, una tendenza che è accelerata durante la pandemia poiché sempre più clienti hanno saltato le interazioni in negozio per interagire virtualmente con le aziende.

Se sono Pizza Hut, non posso certo suonare come quello di Domino, e di certo non posso suonare come quello di Papa John, dice Rupal Patel, professore alla Northeastern University e fondatore e CEO di VocaliD, che promette di costruire voci personalizzate che corrispondono all'identità di marca di un'azienda. Questi marchi hanno pensato ai loro colori. Hanno pensato ai loro caratteri. Ora devono iniziare a pensare anche al modo in cui suona la loro voce.

Karen Hao, Revisione tecnica del MIT · Un esempio di annuncio VocaliD con voce maschile Karen Hao, Revisione tecnica del MIT · Un esempio di annuncio VocaliD con una voce femminile

Mentre le aziende dovevano assumere diversi doppiatori per mercati diversi (il nord-est contro gli Stati Uniti meridionali o la Francia contro il Messico), alcune aziende di IA vocale possono manipolare l'accento o cambiare la lingua di una singola voce in modi diversi. Questo apre la possibilità di adattare gli annunci sulle piattaforme di streaming a seconda di chi sta ascoltando, modificando non solo le caratteristiche della voce ma anche le parole pronunciate. Una pubblicità di birra potrebbe dire a un ascoltatore di fermarsi in un pub diverso a seconda che stia suonando a New York o Toronto, ad esempio. Resemble.ai, che progetta voci per annunci e assistenti intelligenti, afferma che sta già lavorando con i clienti per lanciare tali annunci audio personalizzati su Spotify e Pandora.

Anche le industrie del gioco e dell'intrattenimento stanno vedendo i vantaggi. Sonantic, un'azienda specializzata in voci emotive che possono ridere e piangere o sussurrare e gridare, collabora con produttori di videogiochi e studi di animazione per fornire le voci fuori campo per i loro personaggi. Molti dei suoi clienti utilizzano le voci sintetizzate solo in pre-produzione e passano a doppiatori reali per la produzione finale. Ma Sonantic dice che alcuni hanno iniziato a usarli durante tutto il processo, forse per personaggi con meno battute. Resemble.ai e altri hanno anche lavorato con film e programmi TV per rattoppare le performance degli attori quando le parole vengono confuse o pronunciate male.

Ma ci sono limiti a quanto lontano può arrivare l'IA. È ancora difficile mantenere il realismo di una voce per lunghi periodi di tempo che potrebbero essere necessari per un audiolibro o un podcast. E c'è poca capacità di controllare le prestazioni di una voce AI nello stesso modo in cui un regista può guidare un artista umano. Siamo ancora agli albori del discorso sintetico, afferma Zohaib Ahmed, fondatore e CEO di Resemble.ai, confrontandolo con i giorni in cui la tecnologia CGI veniva utilizzata principalmente per i ritocchi piuttosto che per creare mondi completamente nuovi dai green screen .

Un tocco umano

In altre parole, i doppiatori umani non stanno ancora scomparendo. I progetti espressivi, creativi e di lunga durata sono ancora fatti meglio dagli esseri umani. E per ogni voce sintetica prodotta da queste aziende, un doppiatore deve anche fornire i dati di formazione originali.

Ma alcuni attori sono diventati sempre più preoccupati per i loro mezzi di sussistenza, afferma un portavoce di SAG-AFTRA, il sindacato che rappresenta i doppiatori negli Stati Uniti. Se non hanno paura di essere automatizzati dall'IA, sono preoccupati di essere ricompensati ingiustamente o di perdere il controllo sulle loro voci, che costituiscono il loro marchio e la loro reputazione.

Questo è ora il oggetto di querela contro TikTok proposto dal doppiatore canadese Bev Standing, che sostiene che la funzione di voice over integrata dell'app utilizzi una copia sintetica della sua voce senza il suo permesso. L'esperienza di Standing riecheggia anche quella di Susan Bennett , la voce originale di American Siri, che è stata pagata per le sue registrazioni iniziali ma non per l'uso continuato della sua somiglianza vocale su milioni di dispositivi Apple.

Alcune aziende stanno cercando di essere più responsabili nel modo in cui interagiscono con il settore della recitazione vocale. I migliori, afferma il rappresentante di SAG-AFTRA, si sono rivolti al sindacato per trovare il modo migliore per compensare e rispettare i doppiatori per il loro lavoro.

Questi inquietanti falsi umani annunciano una nuova era nell'IA

Hai bisogno di più dati per il deep learning? Le società di dati sintetici lo faranno per te.

Molti ora utilizzano un modello di partecipazione agli utili per pagare gli attori ogni volta che un cliente concede in licenza la loro specifica voce sintetica, il che ha aperto un nuovo flusso di reddito passivo. Altri coinvolgono gli attori nel processo di progettazione della loro somiglianza con l'IA e danno loro potere di veto sui progetti in cui verranno utilizzati. SAG-AFTRA sta anche spingendo per una legislazione per proteggere gli attori dalle repliche illegittime della loro voce.

Ma per Patel di VocaliD, lo scopo delle voci AI non è in definitiva replicare le prestazioni umane o automatizzare il lavoro di voice-over esistente. Invece, la promessa è che potrebbero aprire possibilità completamente nuove. E se in futuro, dice, le voci sintetiche potessero essere utilizzate per adattare rapidamente i materiali didattici online a un pubblico diverso? Se stai cercando di raggiungere, diciamo, un gruppo di ragazzi del centro città, non sarebbe fantastico se quella voce suonasse davvero come se provenisse dalla loro comunità?

nascondere