自然语言处理

文本摘要(text summarization)

/ TEKST sum-uh-rih-ZAY-shun /

文本摘要是这样一种软件:拿来一篇长文档,把它浓缩成一个保留主旨的短版本——就像一份好的学习辅料把一整章压缩成寥寥几句话。目标是为你省下阅读时间,又不丢掉要紧的东西:要点留下,废话散去。

做法上有两条根本不同的路,这区别很要紧。抽取式摘要从原文里挑出最重要的句子,原封不动地拼接起来——很安全,因为每个字都是真的,但有时读着一顿一顿。生成式摘要则用自己的话另写新句,就像人去转述一样——更顺、更自然,却更冒险,因为一个会写新文本的模型,也会写出原文从未说过的东西。如今多数系统是生成式的,建立在与其他语言模型相同的「预测下一个词」机器之上。

摘要出现在新闻摘要、会议纪要工具、搜索结果片段,以及「太长不看」按钮里。那句坦白的提醒,是关于生成式系统的:它们会出现幻觉——自信地塞进一个原文里没有的事实、名字或数字,或者悄悄把结论翻了个面。一篇读起来漂亮的摘要,仍可能对原文不忠实,这正是为什么在事关重大时,人快速核查一下依旧重要。

对一篇600字的洪灾报道,抽取式输出可能直接抽出含伤亡数字和成因的那两句话。生成式输出则另写一句新话:「暴雨导致河流决堤,造成十二人死亡。」——更顺,但必须对照原文核查。

抽取式搬来真句子;生成式另写新句——也可能偏离真相。

生成式摘要会臆造出原文里压根没有的事实,而一篇流畅的摘要并不自动等于一篇忠实的摘要。ROUGE 衡量的是与参考答案的重合度,而非事实正确性。

又称
summarizationauto-summarization文本摘要自动摘要摘要生成