自然语言处理

ROUGE(摘要评分)

/ ROOZH /

ROUGE 是摘要世界里对应 BLEU 的角色:一个自动评分,衡量机器写出的摘要与人工写的参考摘要有多接近。当你要为成千上万篇文章生成摘要时,没法让人把它们全评一遍,于是 ROUGE 给出一个快速、可重复的数字,用来比较不同版本、追踪进展。这个缩写展开是「面向召回的要旨评估替补」(Recall-Oriented Understudy for Gisting Evaluation)——「要旨」指的正是抓住主旨这件事。

BLEU 偏向精确率(机器用的词里,有多少出现在参考中),ROUGE 则偏向召回率(参考里的词,机器捕捉到了多少)——这恰好契合摘要,因为摘要最怕漏掉要紧的东西。常见的几个变体不难想象:ROUGE-N 数重合的n元语法,ROUGE-L 则奖励在两段文本中以相同顺序出现的最长一串词,粗略地衡量共享的句子流。

对它衡量的东西要看得明白:它量的是与某一份特定人工摘要的词语重合,而非忠实度或可读性。一篇转述得很好却换了用词的摘要会被不公平地扣分;一篇照搬参考措辞却没抓住重点的摘要则被过度奖励。而且 ROUGE 抓不出臆造的事实——一篇自信而错误的摘要,只要共享了足够多的词,照样能拿高分。ROUGE 是开发过程中顺手的导航工具,但最终质量仍得靠人来读一遍。

参考摘要:「The bill passed after a long debate.」机器摘要:「After much debate, the bill was passed.」ROUGE-L 看到一长串共享的词序,便给出高分,尽管措辞被重新排过。

ROUGE-L 给两段摘要按顺序共享的最长一串词记功。

ROUGE 偏重召回(你保住了关键词吗?),衡量的是重合度而非忠实度——它标不出臆造的事实。一篇 ROUGE 高分的摘要照样可能是错的。

又称
ROUGE scorerecall-oriented understudy for gisting evaluationROUGE 分数ROUGE 评分