ROUGE(摘要評分)
/ ROOZH /
ROUGE 是摘要世界裡對應 BLEU 的角色:一個自動評分,衡量機器寫出的摘要與人工寫的參考摘要有多接近。當你要為成千上萬篇文章生成摘要時,沒法讓人把它們全評一遍,於是 ROUGE 給出一個快速、可重複的數字,用來比較不同版本、追蹤進展。這個縮寫展開是「面向召回的要旨評估替補」(Recall-Oriented Understudy for Gisting Evaluation)——「要旨」指的正是抓住主旨這件事。
BLEU 偏向精確率(機器用的詞裡,有多少出現在參考中),ROUGE 則偏向召回率(參考裡的詞,機器捕捉到了多少)——這恰好契合摘要,因為摘要最怕漏掉要緊的東西。常見的幾個變體不難想象:ROUGE-N 數重合的n元語法,ROUGE-L 則獎勵在兩段文本中以相同順序出現的最長一串詞,粗略地衡量共享的句子流。
對它衡量的東西要看得明白:它量的是與某一份特定人工摘要的詞語重合,而非忠實度或可讀性。一篇轉述得很好卻換了用詞的摘要會被不公平地扣分;一篇照搬參考措辭卻沒抓住重點的摘要則被過度獎勵。而且 ROUGE 抓不出臆造的事實——一篇自信而錯誤的摘要,只要共享了足夠多的詞,照樣能拿高分。ROUGE 是開發過程中順手的導航工具,但最終質量仍得靠人來讀一遍。
參考摘要:「The bill passed after a long debate.」機器摘要:「After much debate, the bill was passed.」ROUGE-L 看到一長串共享的詞序,便給出高分,儘管措辭被重新排過。
ROUGE-L 給兩段摘要按順序共享的最長一串詞記功。
ROUGE 偏重召回(你保住了關鍵詞嗎?),衡量的是重合度而非忠實度——它標不出臆造的事實。一篇 ROUGE 高分的摘要照樣可能是錯的。