TF-IDF(詞頻-逆文件頻率)
/ TEE-eff-EYE-dee-eff /
TF-IDF 是一套簡單卻出奇有效的配方,用來給「一個詞對某篇文件(在一個更大的集合裡)有多重要」打分。它的直覺是:一個詞若在某篇文件裡頻繁出現、在別處卻很少出現,那它對這篇文件就重要。「the」在每篇文件裡都沒完沒了地出現,所以拿來區分文件毫無用處。「粒線體」在某一篇生物學文章裡大量出現、在別處幾乎絕跡——於是它成了「這篇文件講什麼」的一枚有力指紋。
名字本身就拼出了相乘的兩半。TF——詞頻——數一個詞在這篇文件裡出現得多頻繁:提及越多,權重越大。IDF——逆文件頻率——則縱觀整個集合,給那些在許多文件裡都冒頭的詞降權:一個詞在集合裡越稀少,就越有辨識度。兩者一乘,一個詞只有在「這裡頻繁」且「整體稀少」時才得高分。這會自動壓下常見的填充詞(無需手工列表就優雅地處置了停用詞),並抬高那些真正刻畫每篇文件特徵的詞。
幾十年來,TF-IDF 一直是搜尋引擎和文件分類器的骨幹,至今仍是一個強勁、快速、透明的基準——好算、好解釋。它誠實的侷限,與它所依託的詞袋模型一樣:它把詞當作互相獨立的符號,因此看不出「car」和「automobile」是一個意思,也完全無視詞序。嵌入能捕捉 TF-IDF 捕捉不了的語義——但 TF-IDF 依然是一個出奇結實、值得最先一試的東西。
在一批新聞文章裡,「said」幾乎篇篇都有,所以它的 IDF 極小,TF-IDF 分數在哪兒都低。「earthquake」在某一篇裡大量出現、別處罕見——那裡 TF 高,整體 IDF 也高——於是它得高分,標出了那篇文章的主題。
TF-IDF 高 = 這裡頻繁、整體稀少 = 一個刻畫本文件特徵的詞。
TF-IDF 會自動給無處不在的詞降權,因此無需手工列表就處理了停用詞——但它仍把詞當作互相獨立的符號,看不見近義詞,也無視詞序。