自然語言處理

詞性標註(part-of-speech tagging)

/ PART-uv-SPEECH TAG-ing /

詞性標註是這樣一樁苦差事:給句子裡的每個詞都貼上它的語法角色標籤——名詞、動詞、形容詞等等——正是你上學時學著分析句子成分的那回事。拿「Time flies like an arrow」來說:標註器會把「Time」標成名詞,「flies」標成動詞,「like」標成介系詞,如此種種。它是語言處理裡最古老、最基礎的工作之一,常常位於許多更大流水線的底層。

它之所以比聽上去更難,是因為同一個詞會因周圍的夥伴不同而扮演不同的角色。「Book」在「read a book」裡是名詞,在「book a flight」裡卻是動詞。「Flies」在「time flies」裡是動詞,在「fruit flies are pests」裡卻是名詞。一個好的標註器不能光背字典;它必須掂量上下文裡的詞。現代標註器從大量已由人標好正確標籤的文本中學習這一點,再推廣到新句子上——這是序列標註的一個經典例子,即每個詞都根據語境得到自己的標籤。

費這個勁圖什麼?知道詞性能幫機器理清「誰對誰做了什麼」、挑出關鍵短語、消解歧義,並把更乾淨的信號餵給翻譯、搜尋和文語轉換(好讓朗讀者知道「read」該讀現在式還是過去式)。在編輯良好的英文上,標註器如今準確率超過97%——但最後那幾個百分點,藏的正是那些真正有歧義的情形,而在非正式文本、新俚語或研究不足的語言上,表現可能會下滑。

「I can fish in a can.」標註:I(代詞)、can(情態動詞)、fish(動詞)、in(介系詞)、a(限定詞)、can(名詞)。同樣拼成「can」——兩個截然不同的標籤,全憑上下文裁定。

同一個詞「can」,因在句中角色不同而得到不同標籤。

標註不是查字典——同一個詞會隨上下文改變詞性,這正是它之所以成為一個學習問題的原因。漂亮的總體準確率,掩蓋了那些真正棘手、含糊的情形。

又稱
POS tagginggrammatical tagging词性标注词类标注