BLEU(機器翻譯評分)
/ BLOO /
BLEU 是一個介於0到1之間(常以0到100呈現)的數字,用來給一段機器翻譯打分,看它與同一句話的一份或多份人工譯文有多接近。它解決的是一個很現實的問題:當一個系統要翻譯幾百萬句話時,你不可能讓人去評判每一條輸出,於是 BLEU 提供了一個快速、自動的替身。這名字帶著調侃——雙語評估替補(Bilingual Evaluation Understudy)——一個頂替人類裁判上場的「替補演員」。
它的運作方式,是檢查短詞塊(即n元語法)的重合度。機器譯文裡的單個詞、詞對和詞三連,有多少也出現在人工參考譯文裡?重合越多,分數越高。它還加了一個簡短懲罰,免得系統靠吐出極短、極保險的輸出來作弊。其結果是一個可供比較的單一數字,你在調試系統時可以一路追蹤它——這正是 BLEU 在二十年裡成為機器翻譯標準標尺的原因。
下面是誠實的部分:BLEU 衡量的是表層的詞語重合,而非意義。一段用詞不同卻同樣正確的好譯文會得低分;一段笨拙卻恰好複用了參考譯文用詞的譯文反而得高分。它獎勵的是措辭吻合,而非翻譯正確。所以 BLEU 用來在同一測試集上比較系統、觀察趨勢是有用的,但單獨一個 BLEU 數字,幾乎說明不了真實質量如何——這也正是人工評估從未徹底退場的原因。
參考譯文:「The cat is on the mat.」機器A:「The cat sits on the mat」——BLEU 很高(共享了大量詞)。機器B:「A feline rests upon the rug」——一段不錯的譯文,BLEU 卻近乎為零,只因它幾乎不與參考共享詞語。
BLEU 獎勵的是與參考譯文用詞吻合——而非把意思譯對。
BLEU 評的是詞語重合,不是意義,所以一段正確的轉述可能得低分,一段彆扭的用詞吻合反而得高分。要在同一測試集上比較系統;切勿把孤零零一個 BLEU 數字當作質量的定論。