211service.com
Ripeti, in inglese, per favore
Sebbene la qualità delle traduzioni eseguite al computer sia migliorata notevolmente negli ultimi 20 anni, alcuni risultati sono ancora grammaticalmente stupidi come le istruzioni su un involucro di bacchette. Prendi, ad esempio, un sito web per a Fattoria di mele giapponese che è stato convertito in inglese utilizzando Google's servizio di traduzione automatica :
Il giardino di mele Someya passerà molto! Viene piantato nel 1954, inoltre ancora oggi supera l'età dell'albero di 50 anni in modo prospero, grande - arrivando l'albero anormale gioco alligatore la mela è fruttificata. La gustosa mela dove la differenza di temperatura del giorno e della notte si è stretta per essere estrema prefettura di Gunma, la città di Numata, le cui quattro stagioni sono chiare, la natura è dura. *
Sì, il quadro generale viene trasmesso, ma molto viene perso dall'algoritmo di traduzione dal giapponese all'inglese di Google. Google offre la sua funzione di traduzione da diversi anni, così come la società Internet con sede in Canada Pesce Babele . Più di recente, tuttavia, gli sviluppatori di software commerciali hanno iniziato a esplorare la traduzione al di là di una pagina Web statica o di un documento elettronico e stanno applicando la tecnologia alle conversazioni di messaggistica istantanea Internet in tempo reale. All'inizio di questo mese, AvMedia ha rilasciato una messaggistica istantanea traduttore progettato per facilitare la chat con gli amici che parlano tedesco, spagnolo, francese, italiano e portoghese per chi parla inglese e viceversa (il francese può anche essere tradotto in tedesco e il tedesco in francese).
Ma tutto questo software manca ancora di una precisione sufficiente per essere utile in situazioni impegnative, come trattative commerciali o pianificazione militare. Ciò è probabilmente dovuto al fatto che la maggior parte dei software commerciali segue un approccio tradizionale alla traduzione automatica, afferma Kevin Knight, informatico presso la University of Southern California Istituto di scienze dell'informazione (ISI) e co-fondatore della società con sede in California Tessitore di lingue .
Tradizionalmente, il software di traduzione automatica dipendeva da algoritmi che ordinavano migliaia di regole grammaticali per le due lingue da tradurre, afferma Knight. Il problema, spiega, è che così tante regole devono essere scritte manualmente, così come le eccezioni a queste regole, e l'imprecisione si insinua quando insiemi complessi di regole si contraddicono a vicenda. Se scrivi la 5000esima regola, a volte rompi le cose, dice Knight.
Con Language Weaver e la sua ricerca alla USC, Knight, così come una manciata di altri ricercatori in tutto il mondo, affrontano il problema in modo diverso. Invece di seguire rigide regole grammaticali, Language Weaver abbina parole e frasi corrette tra le lingue in base alla probabilità che tali parole e frasi siano corrette in un dato contesto.
Questo approccio statistico attinge a un gran numero di esempi da documenti già tradotti, afferma Michael Collins, un ingegnere informatico del MIT che utilizza lo stesso metodo per un'applicazione software che sta costruendo per eseguire traduzioni dal tedesco all'inglese. IBM ha aperto la strada a questo approccio negli anni '90, dice, in parte, sfruttando un enorme database di atti parlamentari canadesi pubblicati in entrambe le versioni francese e inglese.
La varietà statistica della traduzione automatica non solo produce risultati migliori rispetto al metodo tradizionale, afferma Knight, ma anche il software è progettato per continuare a migliorare da solo. Più documenti tradotti incontra il software, più è probabile che corrisponda correttamente alle frasi. Alcuni anni fa, per le nostre lingue cinese e araba, tutto ciò che potevamo ottenere era l'argomento di base di cosa trattasse un articolo, dice Knight. Ora, la risoluzione è a livello di frase. [Continua alla pagina successiva]
-
* Correzione, 18 gennaio 2006, 10:00 EST: Nella versione originale di questa storia, abbiamo citato la seguente traduzione del sito web di Someya Apple Farm: Il meleto con grandi alberi di oltre 50 anni. L'ambiente naturale intorno a Numata, con l'enorme differenza di temperatura tra il giorno e la notte, crea una mela deliziosamente unica. In realtà, questo era un estratto dalla traduzione di Google della versione inglese del suo sito Web della fattoria di mele, non dalla traduzione di Google della pagina originale giapponese. Pertanto non era un valido esempio della scarsa qualità di alcuni algoritmi di traduzione automatica. Nella storia abbiamo ora sostituito la traduzione di Google del sito originale giapponese. Grazie ai nostri lettori per aver segnalato l'errore. - Ed.
L'Agenzia per i progetti di ricerca avanzata della difesa degli Stati Uniti (DARPA) è uno dei principali finanziatori della traduzione automatica statistica. Lo scorso agosto, la DARPA ha sponsorizzato test di traduzione automatica per documenti cinesi e arabi; un gruppo di ricerca di Google ha ottenuto il punteggio più alto, superando l'Information Sciences Institute di USC e il braccio di traduzione automatica di IBM. Google, che utilizza anche l'approccio statistico, potrebbe aver avuto un vantaggio, osserva Knight, perché potrebbe utilizzare un numero enorme di computer per il word-crunching e potrebbe attingere all'intera Internet per il suo database di documenti pretradotti.
Nel 2005, DARPA ha anche annunciato il programma Global Autonomous Language Exploitation (GALE), destinato ad accelerare l'elaborazione informatica di un numero enorme di documenti tradotti acquisiti dal suo programma principale, il programma con sede a Filadelfia Consorzio dati linguistici .** GALE è attualmente al primo anno e trascriverà discorsi da fonti di notizie trasmesse e talk show in arabo, cinese e inglese, oltre a catalogare feed di newswire di testo, gruppi di discussione di notizie Web e blog in quelle lingue. Per ora, il progetto si concentra principalmente sulla raccolta di dati da questi generi, con i ricercatori del dipartimento di informatica e ingegneria dell'Università della Pennsylvania che svolgono gran parte del lavoro.
Ma anche con un'ampia raccolta di materiale tradotto, ci saranno ancora problemi linguistici da risolvere. Il prossimo passo nella ricerca sulla traduzione automatica, oltre a far corrispondere parole e frasi, dice Knight, è quello di appianare le incongruenze grammaticali che sorgono quando parole e frasi sono messe insieme. Questo livellamento può essere ottenuto indicizzando milioni di frasi le cui strutture sono state schematizzate presso l'Università della Pennsylvania negli anni '90 (i dati provenivano da 50.000 frasi nel giornale di Wall Street ). Simile al modo in cui un database pieno di parole e frasi consente al software di traduzione di scegliere la combinazione di parole statisticamente più probabile, questi esempi specifici di grammatica dalle frasi rappresentate in diagramma aiutano il software ad assegnare la probabilità dell'ordine delle parole, afferma Collins del MIT.
Questo è un progresso rispetto al metodo tradizionale in cui le regole grammaticali sono state impostate in un algoritmo, dice. Piuttosto che obbedire alle convenzioni grammaticali codificate in un algoritmo, come con la traduzione automatica tradizionale, il database delle frasi con diagrammi consente al software di assegnare probabilità e peso a tali regole, afferma Collins. È più probabile che [il software] impari il contesto, dice.
In qualche modo, tuttavia, l'approccio statistico sarà valido solo quanto il comune traduttore di messaggistica istantanea. I nomi propri, ad esempio, continuano a inciampare anche nel traduttore automatico più letto e spesso vengono tradotti insieme al resto del testo. Secondo il suo sistema, ammette Knight, la versione spagnola del suo cognome è ancora Kevin Caballero.
** Correzione, 20 gennaio 2006: La versione originale di questa storia, pubblicata il 18 gennaio, affermava che il Linguistic Data Consortium è stato lanciato nel 2005. In effetti, il consorzio è stato lanciato nel 1992 e il suo progetto Global Autonomous Language Exploitation è stato lanciato nel 2005. – Eds.