211service.com
Perché il discorso sintetizzato suona così orribile?
abbiamo tricorder , teletrasporto e interfacce touch-screen dinamiche , ma non la previsione più banale di Star Trek e innumerevoli altri franchise di fantascienza: discorso sintetizzato simile a quello umano.
Quelli di voi che non hanno ascoltato un discorso sintetizzato dall'ultima volta che l'hanno guardato Una breve storia del tempo , preparati ad essere deluso dal mancanza di progressi . Ecco Roger Ebert che utilizza un sintetizzatore vocale preprogrammato con la propria voce:
E qui, solo per riferimento, c'è qualcosa di non meno intelligibile e solo un po' più robotico, solo che ha circa 25 anni e gira su un computer con circa 1/62.000 di memoria:
Se questo è lo stato dell'arte, c'è da meravigliarsi che il La Gilda degli autori non sembra più preoccuparsi che l'iPad, come il Kindle, può leggere un documento ad alta voce?
Certo, confrontando il dispositivo di generazione del parlato (SGD) di Ebert con quello di Hawking rivela che ora abbiamo la capacità di creare un computer Robby -esque voice suona qualcosa come la persona la cui voce è destinata a sostituire un SGD - un buon primo passo nell'uso di questi dispositivi per chi soffre di malattie degenerative come la SLA o, nel caso di Ebert, una perdita dovuta al cancro.
SGD che suonano come un individuo sono possibili a causa di ciò che è noto come sintesi vocale basata sui dati o sintesi vocale concatenativa. Questa tecnica viene utilizzata di concerto con servizi bancari vocali , in cui un utente che sa che perderà il potere del discorso lo registra con ore di anticipo.
Discorso sintetizzato e discorso concatenato
A differenza del discorso veramente sintetizzato, un compito erculeo che richiede a un programmatore di generare una voce da zero utilizzando solo modifiche dei suoni di base, la sintesi vocale basata sui dati attinge a una libreria di ore di discorso naturale, riproducendone brevi sezioni per comporre qualsiasi parola nella lingua di arrivo. È un po' come la differenza tra i sintetizzatori musicali della vecchia scuola e il campionamento.
Monofoni, Difoni, Trifoni…
La sintesi vocale basata sui dati presenta una serie di problemi. Il primo è che compone il discorso dai difoni - coppie di suoni di parole. Questo è abbastanza impegnativo dal punto di vista computazionale: ogni parola pronunciata dal SGD deve essere composta da più difoni che deve identificare nel suo database esistente.
Ciò significa migliaia e migliaia di difoni, eppure le parole che pronunciamo non sono semplici concatenazioni di coppie di suoni; alcune parole sono raccolte di suoni a sé stanti e i difoni comuni a due parole potrebbero non suonare correttamente in una terza, il che potrebbe richiedere un trifono o anche qualcosa di più. È facile vedere come il numero di possibili combinazioni tra cui un SGD dovrebbe scegliere diventi rapidamente un problema irrisolvibile quando si va oltre le semplici unità a due suoni.
Il problema monotono
Anche i migliori sistemi vocali concatenati disponibili in commercio non tentano nemmeno di superare il problema dell'enfasi. Nel linguaggio normale, trasmettiamo emozioni attraverso una serie di trucchi: pause, tempi delle sillabe, tono. Anche in laboratorio, i migliori tentativi di mettere emozioni come rabbia e paura in un discorso sintetizzato trasmettere con successo questi sentimenti solo circa il 60% delle volte ( pdf qui ), e i numeri sono ancora peggiori per la gioia.
Come l'intelligenza artificiale, il riconoscimento vocale e la visione artificiale, la sintesi vocale è un'altra delle funzioni che gli esseri umani svolgono facilmente e che finora abbiamo trovato incredibilmente difficile da riprodurre in silicone .