自然语言处理
问答系统(question answering)
/ KWES-chun AN-ser-ing /
问答系统正如其名:你用大白话提一个问题,系统直接给你一个答案,而不是甩给你一串得自己去趟的链接。「珠穆朗玛峰有多高?」该回来一句「约8849米」,而不是十个网页。这就是「一个把干草堆塞给你的搜索引擎」与「一个替你找出那根针的助手」之间的区别。
大体上有两种风格。抽取式问答会拿到一段文字,必须在其中找出回答问题的那一段文本——像一道阅读理解题,每个答案都藏在段落的某处。开放域问答更难:系统得先从一个庞大的文档集合里检索出相关资料,再去抽取或拼出答案,这正是「检索增强」助手背后的配方。聊天机器人用的生成式问答,则借助训练时学到的东西,用自己的话把答案写出来。
问答是语音助手、客服机器人,以及如今会用整句作答的搜索框的骨干。但诚实的局限很尖锐。系统可以自信作答却全盘皆错,尤其是当它凭记忆生成、而非去查证时——它天生没有「这事我其实不知道」的分寸感。它会被问题的措辞方式骗到,在多步推理上吃力,还会鹦鹉学舌地复述过时的事实。把答案锚定在可信来源上、并标明出处,是目前最好的防线。
段落:「埃菲尔铁塔于1889年竣工,高330米。」问题:「埃菲尔铁塔何时竣工?」抽取式问答的答法,是指向「1889」这一段确切的文本——答案是被找出来的,而非被编出来的。
抽取式问答是在给定段落里定位答案,而非生成答案。
问答系统天生没有「我不知道」的分寸——它能错得理直气壮,凭记忆生成时尤其如此。把答案锚定在可引用的来源上,是主要的防护措施。
又称
另见