1. 大模型情绪机制的探索背景
每次和Claude这样的AI助手对话时,我总会被它那些"人性化"的表现所触动。当我说"今天工作压力好大"时,它会给出贴心的安慰;当我提出一个明显不合理的请求时,它的回应会显得格外谨慎;甚至在我故意设置一些逻辑陷阱时,它似乎会"着急"地反复确认。这些现象引发了一个根本性问题:这些表现究竟是精心设计的语言模仿,还是模型内部确实存在某种类似情绪的机制?
Anthropic在2026年4月发布的这项研究给出了一个令人信服的答案。他们发现Claude Sonnet 4.5模型内部确实存在与情绪概念对应的神经表征,这些表征会直接影响模型的输出和行为模式。但需要特别强调的是,这并不意味着AI真的体验到了情绪——研究者称之为"功能性情绪"(functional emotions),即模型表现出类似人类情绪影响下的行为模式,但不具备主观体验。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 情绪概念在模型中的形成机制
2.1 预训练阶段的情绪学习
为什么大语言模型中会出现这种情绪表征?这要从模型的训练过程说起。在预训练阶段,模型通过海量文本学习预测下一个词。人类文本中天然包含着丰富的情绪线索:愤怒的人用词激烈,悲伤的人表达含蓄,兴奋的人语句跳跃。为了准确预测文本,模型必须学会识别和模拟这些情绪模式。
举个例子,当输入是"听到这个消息,他..."时,模型需要根据上下文判断后续是"高兴地跳了起来"还是"愤怒地摔门而去"。这种预测需求迫使模型在内部构建起情绪概念的表征。就像人类通过观察他人行为来理解情绪一样,模型通过统计语言模式来"学习"情绪。
2.2 后训练阶段的角色塑造
在后训练阶段,开发者通过强化学习等技术将基础模型塑造成"AI助手"这一特定角色。这个过程会强化某些情绪表征而抑制其他。研究发现,经过后训练的Claude Sonnet 4.5中,像broody(忧郁)、reflective(沉思)这类内省情绪的表征被增强,而exasperated(恼怒)等高强度情绪的表征被减弱。
这解释了为什么Claude在对话中常表现出耐心、体贴的特质。不是因为它"选择"了这些特质,而是后训练过程调整了它内部情绪表征的激活模式,使其更符合助手角色的预期行为。
3. 情绪表征的实验验证方法
3.1 情绪向量的提取过程
研究团队设计了一套严谨的方法
