AT&T vuole mettere la tua voce al comando delle app

Nel tentativo di rendere la parola il modo dominante in cui le persone controllano la tecnologia, AT&T sta aprendo la sua tecnologia di riconoscimento vocale affinché gli altri possano usarla. A partire da giugno, gli ingegneri del software possono attingere a un servizio cloud offerto dall'azienda per far sì che qualsiasi dispositivo in grado di connettersi a Internet risponda alla voce del suo padrone.





Che cosa?: Una dimostrazione in laboratorio mostra una conversazione in tempo reale tra un inglese e uno spagnolo. Le parole pronunciate sono state tradotte in testo, tradotte e pronunciate dalla macchina all'ascoltatore su entrambe le estremità.

AT&T ritiene che la tecnologia possa essere utilizzata per qualsiasi cosa, dalle app per smartphone e giochi online alle automobili e agli elettrodomestici. Mentre l'offerta iniziale convertirà solo il parlato in testo e i comandi corrispondenti, l'azienda sta prendendo in considerazione una serie più ampia di offerte in un secondo momento, comprese quelle che traducono il testo inglese in altre sei lingue e viceversa, e possono anche sintetizzare il discorso tradotto.

Crediamo che ci siano molte persone intelligenti là fuori che possono creare applicazioni e servizi che non abbiamo mai sognato prima, afferma Mazin Gilbert, vicepresidente per la ricerca sui sistemi intelligenti presso AT&T Labs a Florham Park, nel New Jersey. Per utilizzare la tecnologia, gli sviluppatori scrivono codice nel loro software per sfruttare un'API (interfaccia di programmazione dell'applicazione) specificata da AT&T. Questo codice fa sì che un'applicazione invii la voce ad AT&T su Internet, dove viene convertita in testo e restituita al dispositivo. Le nuove API erano annunciato la scorsa settimana. AT&T afferma che la tecnologia è accurata al 95% nel prendere il parlato inglese e nel renderlo come testo. Dice che la sua precisione nel convertire il significato del testo inglese da e verso altre lingue varia dal 70 percento all'80 percento.



La tecnologia vocale di base ora offerta da AT&T è già utilizzata in molte delle sue applicazioni, incluso il Applicazione di traduzione AT&T per telefoni Android e iOS e ricerca nella rubrica vocale mobile fornita da Pagine Gialle . Voglio essere in grado di avere un milione di app sulla nostra piattaforma, non centinaia, come abbiamo oggi, dice Gilbert. Qualunque sia la tua idea stravagante, vogliamo fornire quelle API. Sarò onesto: non so per cosa le persone lo useranno.

La tecnologia AT&T si basa su decenni di innovazione presso i Bell Labs prima dello scioglimento di AT&T e della successiva creazione dei laboratori AT&T incentrati sui servizi. Tuttavia, l'azienda deve competere con fornitori più affermati di tecnologia di riconoscimento vocale, soprattutto nel campo degli smartphone.

Per esempio, Sfumatura fornisce funzionalità di riconoscimento vocale a molte aziende tra cui, secondo quanto riferito, Apple per il suo assistente personale Siri. La tecnologia di riconoscimento vocale di Google è offerta in tutto il suo sistema operativo per smartphone Android e da qualsiasi app scritta per un dispositivo Android. Microsoft dispone anche di una tecnologia di riconoscimento vocale, che compare nel suo sistema operativo Windows Phone e nei prodotti di partner come Ford, con il suo sistema Sync per l'intrattenimento in auto.



Krish Prabhu, CEO di AT&T Labs, ritiene che rendere ampiamente disponibile la tecnologia vocale consentirà al mobile computing di essere più capace e di crescere più rapidamente. Nel contesto di un mondo in cui abbiamo ampiamente risolto la connettività e raggiunto i problemi, anche se ci sono ancora problemi, questo sforzo sulla parola deriva dalla convinzione che l'interfaccia alla rete debba diventare più semplice, ha detto durante una dimostrazione in laboratorio a New York. York la scorsa settimana. Stiamo cercando di aprire la strada affinché la tecnologia non sia la cosa che ci ferma.

Le API di AT&T per la sintesi vocale, che verranno lanciate a giugno, consistono in sette versioni su misura per usi specifici, come dettare messaggi di testo, cercare attività commerciali locali, rispondere a domande, trasformare messaggi vocali in testo ed eseguire dettature generali. In futuro verranno aggiunte anche API specifiche per giochi online e social network.

Successivamente, potrebbero essere disponibili API che traducono il testo tra l'inglese e altre sei lingue: spagnolo, francese, italiano, tedesco, cinese e giapponese. Altre lingue, tra cui coreano e arabo, sono in cantiere, ma AT&T sarà molto indietro rispetto ai concorrenti. Ad esempio, Google offre già agli sviluppatori strumenti in grado di tradurre tra più di mille combinazioni linguistiche.



Gilbert afferma che l'uso di tutte le API comporterebbe una quota di registrazione di $ 99 per il 2012 e che i piani post-2012 non erano pubblici. Google addebita le proprie API di traduzione.

Per migliorare l'accuratezza del riconoscimento vocale o del software di traduzione è necessario ottenere più dati di esempio per addestrare gli algoritmi sottostanti. Per aiutare questo processo, AT&T potrebbe eventualmente sollecitare un feedback dalle persone che utilizzano prodotti che hanno la sua tecnologia vocale e di traduzione integrata. Il crowdsourcing consentirebbe a questo di raggiungere livelli di accuratezza molto più elevati e, a sua volta, favorirebbe un'adozione più ampia e utenti molto più felici, afferma Sam Ramji, uno scienziato informatico che è vicepresidente per la strategia presso Apigee , che costruisce piattaforme API e sta lavorando al progetto AT&T.

Ramji crede che rendere facilmente disponibile una buona tecnologia di riconoscimento vocale potrebbe lentamente estinguere i menu tradizionali e le interfacce testuali. Le interfacce utente di oggi sono come alberi che dobbiamo navigare per riflettere la struttura del programma. Quello che dovrebbe succedere è che i dispositivi analizzino il comando che esce dalla nostra bocca, dice.



nascondere