自然語言處理
問答系統(question answering)
/ KWES-chun AN-ser-ing /
問答系統正如其名:你用大白話提一個問題,系統直接給你一個答案,而不是甩給你一串得自己去趟的連結。「珠穆朗瑪峰有多高?」該回來一句「約8849公尺」,而不是十個網頁。這就是「一個把乾草堆塞給你的搜尋引擎」與「一個替你找出那根針的助手」之間的區別。
大體上有兩種風格。抽取式問答會拿到一段文字,必須在其中找出回答問題的那一段文本——像一道閱讀理解題,每個答案都藏在段落的某處。開放域問答更難:系統得先從一個龐大的文件集合裡檢索出相關資料,再去抽取或拼出答案,這正是「檢索增強」助手背後的配方。聊天機器人用的生成式問答,則借助訓練時學到的東西,用自己的話把答案寫出來。
問答是語音助手、客服機器人,以及如今會用整句作答的搜尋框的骨幹。但誠實的侷限很尖銳。系統可以自信作答卻全盤皆錯,尤其是當它憑記憶生成、而非去查證時——它天生沒有「這事我其實不知道」的分寸感。它會被問題的措辭方式騙到,在多步推理上吃力,還會鸚鵡學舌地複述過時的事實。把答案錨定在可信來源上、並標明出處,是目前最好的防線。
段落:「艾菲爾鐵塔於1889年竣工,高330公尺。」問題:「艾菲爾鐵塔何時竣工?」抽取式問答的答法,是指向「1889」這一段確切的文本——答案是被找出來的,而非被編出來的。
抽取式問答是在給定段落裡定位答案,而非生成答案。
問答系統天生沒有「我不知道」的分寸——它能錯得理直氣壯,憑記憶生成時尤其如此。把答案錨定在可引用的來源上,是主要的防護措施。
又稱
另見