自然語言處理

機器翻譯(machine translation)

/ muh-SHEEN tranz-LAY-shun /

機器翻譯是把一種語言的文本變成另一種語言的軟體——就是你手機和瀏覽器上那個翻譯按鈕背後的技術。這個夢想很古老,難度也一樣古老:語言並非逐詞對應。它們的詞序不同,刻意標記的東西也不同(性別、敬語、時態),還有那些字面上講不通的習語(「下貓下狗」其實是「傾盆大雨」)。好的翻譯不是替換字典詞條;而是用一門新語言把意思重新說一遍。

這個領域經歷了三大時代。基於規則的系統手工編寫語法和詞典——在狹窄領域裡準確,出了那個領域便處處脆弱。統計系統則透過對齊數百萬人工翻譯的句對,學會詞與短語的對應——更穩健,但讀起來一頓一頓的。接著來了神經機器翻譯:一個編碼器把整句源文讀進一個語義表示,一個解碼器再把譯文寫出來,是一次性考量整句、而非一個短語接一個短語。這就是編碼器—解碼器結構,而讓它大放異彩的注意力機制,正是今天大語言模型背後那個 Transformer 架構的種子。

現代系統確實令人讚嘆,是旅行、商務和上網閱讀的日常便利。但要坦白其中的缺口:碰上訓練資料稀少的小語種它會失手,在長段落裡會丟失或憑空編造細節,會漏掉文化與法律上的微妙之處,還可能給出一段流暢卻細微而危險地錯誤的譯文。用來隨意理解,它們妙不可言;可一旦涉及合約、醫療或文學,仍得有人來把關。

英文「She kicked the bucket」不該被譯成「她踢了水桶」——它的意思是「她去世了」。好的系統翻譯的是這個習語的含義,而非它的字面詞語;差的系統則會給出一句令人莫名其妙的直譯。

翻譯意思,而非詞語——習語正是直譯系統翻車的地方。

流暢的輸出不等於正確的輸出:機器翻譯可能讀起來順暢,卻悄悄漏掉一個「不」字或編出一個細節。對於高風險的文本,請始終讓人來複核。

又稱
MTautomatic translation机器翻译神经机器翻译neural machine translationNMT