自然語言處理

停用詞(stop words)

/ STOP wurdz /

停用詞,是那些微小而極常見、給句子上油潤滑、本身卻幾乎不承載主題意義的詞——「the」「a」「is」「of」「and」「to」。在許多經典的文本處理任務裡,竅門就是乾脆把它們刪掉。如果你想弄清一篇文件講的是什麼,「the」到處都是,什麼也告訴不了你,而「冰川」或「破產」則透露得多得多。所謂停用詞表,無非就是你決定要扔掉的那一份詞語名冊。

刪除它們曾經幾乎是一個自動的第一步。在搜尋引擎或詞袋分類器裡,剔除停用詞能縮小資料、加快速度,並阻止那些最頻繁卻空洞的詞把有意義的詞淹沒。並不存在一份官方的通用列表——它取決於語言和任務,你按需自建或借用一份。TF-IDF 用一種更優雅的方式達到類似效果:它給那些到處出現的詞降低權重,而非乾脆刪掉。

難處在這裡,而且不小:停用詞只是對某些任務才「無意義」。把它們扔掉,「to be or not to be」(生存還是毀滅)就成了空空一片。對於短語檢索、情感分析(「not good」全繫於那個「not」),尤其是現代神經模型,那些小詞承載著至關重要的語法與微妙意味。所以停用詞刪除對老式關鍵詞方法是個有用的工具,但今天的語言模型會保留每一個詞——事實證明,這些功能詞遠比早年的直覺所設想的要重要得多。

用一份標準停用詞表過濾「the cat is on the mat」,只剩下「cat mat」——拿來猜主題沒問題。可對「to be or not to be」做同樣的事,幾乎什麼都不剩,因為在這裡,那些小詞正是要害。

丟掉停用詞有助於辨別主題,卻可能掏空承載意義的短語。

停用詞只是對某些任務才「無用」——「not good」裡的「not」、整句「to be or not to be」用的都是停用詞。現代神經模型會保留每一個詞;停用詞刪除屬於老式的關鍵詞工具箱。

又稱
stopwords停用词虚词过滤