BLEU(机器翻译评分)
/ BLOO /
BLEU 是一个介于0到1之间(常以0到100呈现)的数字,用来给一段机器翻译打分,看它与同一句话的一份或多份人工译文有多接近。它解决的是一个很现实的问题:当一个系统要翻译几百万句话时,你不可能让人去评判每一条输出,于是 BLEU 提供了一个快速、自动的替身。这名字带着调侃——双语评估替补(Bilingual Evaluation Understudy)——一个顶替人类裁判上场的「替补演员」。
它的运作方式,是检查短词块(即n元语法)的重合度。机器译文里的单个词、词对和词三连,有多少也出现在人工参考译文里?重合越多,分数越高。它还加了一个简短惩罚,免得系统靠吐出极短、极保险的输出来作弊。其结果是一个可供比较的单一数字,你在调试系统时可以一路追踪它——这正是 BLEU 在二十年里成为机器翻译标准标尺的原因。
下面是诚实的部分:BLEU 衡量的是表层的词语重合,而非意义。一段用词不同却同样正确的好译文会得低分;一段笨拙却恰好复用了参考译文用词的译文反而得高分。它奖励的是措辞吻合,而非翻译正确。所以 BLEU 用来在同一测试集上比较系统、观察趋势是有用的,但单独一个 BLEU 数字,几乎说明不了真实质量如何——这也正是人工评估从未彻底退场的原因。
参考译文:「The cat is on the mat.」机器A:「The cat sits on the mat」——BLEU 很高(共享了大量词)。机器B:「A feline rests upon the rug」——一段不错的译文,BLEU 却近乎为零,只因它几乎不与参考共享词语。
BLEU 奖励的是与参考译文用词吻合——而非把意思译对。
BLEU 评的是词语重合,不是意义,所以一段正确的转述可能得低分,一段别扭的用词吻合反而得高分。要在同一测试集上比较系统;切勿把孤零零一个 BLEU 数字当作质量的定论。