自然語言處理

文本摘要(text summarization)

/ TEKST sum-uh-rih-ZAY-shun /

文本摘要是這樣一種軟體:拿來一篇長文件,把它濃縮成一個保留主旨的短版本——就像一份好的學習輔料把一整章壓縮成寥寥幾句話。目標是為你省下閱讀時間,又不丟掉要緊的東西:要點留下,廢話散去。

做法上有兩條根本不同的路,這區別很要緊。抽取式摘要從原文裡挑出最重要的句子,原封不動地拼接起來——很安全,因為每個字都是真的,但有時讀著一頓一頓。生成式摘要則用自己的話另寫新句,就像人去轉述一樣——更順、更自然,卻更冒險,因為一個會寫新文本的模型,也會寫出原文從未說過的東西。如今多數系統是生成式的,建立在與其他語言模型相同的「預測下一個詞」機器之上。

摘要出現在新聞摘要、會議紀要工具、搜尋結果片段,以及「太長不看」按鈕裡。那句坦白的提醒,是關於生成式系統的:它們會出現幻覺——自信地塞進一個原文裡沒有的事實、名字或數字,或者悄悄把結論翻了個面。一篇讀起來漂亮的摘要,仍可能對原文不忠實,這正是為什麼在事關重大時,人快速核查一下依舊重要。

對一篇600字的洪災報導,抽取式輸出可能直接抽出含傷亡數字和成因的那兩句話。生成式輸出則另寫一句新話:「暴雨導致河流決堤,造成十二人死亡。」——更順,但必須對照原文核查。

抽取式搬來真句子;生成式另寫新句——也可能偏離真相。

生成式摘要會臆造出原文裡壓根沒有的事實,而一篇流暢的摘要並不自動等於一篇忠實的摘要。ROUGE 衡量的是與參考答案的重合度,而非事實正確性。

又稱
summarizationauto-summarization文本摘要自动摘要摘要生成