自然语言处理

停用词(stop words)

/ STOP wurdz /

停用词,是那些微小而极常见、给句子上油润滑、本身却几乎不承载主题意义的词——「the」「a」「is」「of」「and」「to」。在许多经典的文本处理任务里,窍门就是干脆把它们删掉。如果你想弄清一篇文档讲的是什么,「the」到处都是,什么也告诉不了你,而「冰川」或「破产」则透露得多得多。所谓停用词表,无非就是你决定要扔掉的那一份词语名册。

删除它们曾经几乎是一个自动的第一步。在搜索引擎或词袋分类器里,剔除停用词能缩小数据、加快速度,并阻止那些最频繁却空洞的词把有意义的词淹没。并不存在一份官方的通用列表——它取决于语言和任务,你按需自建或借用一份。TF-IDF 用一种更优雅的方式达到类似效果:它给那些到处出现的词降低权重,而非干脆删掉。

难处在这里,而且不小:停用词只是对某些任务才「无意义」。把它们扔掉,「to be or not to be」(生存还是毁灭)就成了空空一片。对于短语检索、情感分析(「not good」全系于那个「not」),尤其是现代神经模型,那些小词承载着至关重要的语法与微妙意味。所以停用词删除对老式关键词方法是个有用的工具,但今天的语言模型会保留每一个词——事实证明,这些功能词远比早年的直觉所设想的要重要得多。

用一份标准停用词表过滤「the cat is on the mat」,只剩下「cat mat」——拿来猜主题没问题。可对「to be or not to be」做同样的事,几乎什么都不剩,因为在这里,那些小词正是要害。

丢掉停用词有助于辨别主题,却可能掏空承载意义的短语。

停用词只是对某些任务才「无用」——「not good」里的「not」、整句「to be or not to be」用的都是停用词。现代神经模型会保留每一个词;停用词删除属于老式的关键词工具箱。

又称
stopwords停用词虚词过滤