情绪、动机与奖赏

奖赏预测误差

奖赏预测误差是大脑衡量"好事带来的意外"的方式——也就是你预期得到的奖赏,与你实际得到的奖赏之间的差距。设想你咬了一口三明治,本以为平淡无味,结果却异常美味:这种"比我想的还好"的愉快冲击,就是正向预测误差。反过来,如果它比你期望的还难吃,那一丝失望的刺痛,就是负向预测误差。而如果它恰好和预期一样好,就没有任何误差——没有意外,也没有新东西可学。大脑在意的,与其说是奖赏本身,不如说是奖赏究竟超出还是落后于自己的预测。

这个信号主要由多巴胺传递,多巴胺是中脑深处一小簇细胞释放的化学信使。当某件事比预期更好时,这些细胞会发出一阵短促的放电,释放出额外的多巴胺;当某件事比预期更差时,它们会短暂地安静下来,跌到平时那种稳定细流之下。一份完全在意料之中、如期而至的奖赏,几乎不会引起任何变化。实际上,多巴胺并不只是一个"快乐信号",而是一个教学信号,宣告这次意外的大小和方向。

这为什么重要?因为这种意外正是学习所需要的。大脑用预测误差来更新自己的预期:正向误差促使你重复并看重那些带来好结果的行为,负向误差则告诉你降低期望、换别的办法试试。经过多次重复,预测会变得越来越准,误差也会朝零收缩——习惯、渴求和熟练的选择就是这样形成的。同样这套机制一旦被劫持,也有助于解释成瘾;它还被训练人工智能所用的"奖赏信号"所借鉴。

关键点:多巴胺传递的是意外——奖赏比预期好了多少或差了多少——而不是奖赏本身带来的快乐。

又称
RPEreward prediction-error signal奖励预测误差獎勵預測誤差