自然语言处理

情感分析(sentiment analysis)

/ SEN-tih-ment uh-NAL-uh-sis /

情感分析是教计算机读一段文字、判断其背后的情绪——这条评论是正面、负面还是中性?这条推文是愤怒还是欣喜?最简单时,它把文本分成「赞」或「踩」;更精细的版本会评定强度,或挑出具体的情绪。企业用它在几秒钟内扫过成千上万条产品评论或社媒帖子,这是任何人类团队都跟不上的活儿。

在底层,它通常是一个文本分类问题:你收集大量已经标好情感的例子,模型从中学到哪些词和短语偏向哪一边。早期系统依赖词表(「excellent」= 正面,「terrible」= 负面);现代系统则用嵌入和神经网络来权衡整句话。同样的技术还能把情感对准更细的颗粒——「电池很棒,但屏幕糟透了」对一个特性是正面,对另一个则是负面。

诚实的难处在于,人的情绪很滑溜,机器会错过人一眼就抓住的东西。反讽是经典的陷阱:「哦,太好了,又延误了」表面光鲜,底下却尽是苦涩。否定(「一点都不差」)、比较、文化语境和表情符号,都会把模型绊倒。情感分析在从堆积如山的文本里发现总体趋势上确实有用,但对任何单条预测都要谨慎相待——它读的是表层信号,并非真正理解一个人的感受。

评论:「哇,包裹只花了三周就到了。太棒了。」一个天真的模型看到「哇」和「太棒了」就判为正面——却没读出那层反讽:三周慢得让人无法接受。

反讽——褒义的词,贬义的意——是情感分析经典的盲点。

情感模型读的是表层词语信号,所以反讽、否定和文化语境常常把它们骗过去。要信赖成千上万条文本汇总出的总体趋势;要怀疑任何单一的标签。

又称
opinion mining情感分析情感倾向分析意见挖掘