1. 分类分布强化学习的核心突破:不确定性感知正则化探索
在强化学习领域,分类分布强化学习(Categorical Distributional RL,简称CDRL)近年来展现出超越传统方法的性能优势,但其理论机制一直缺乏系统性解释。本文要介绍的这项研究通过创新的"回报密度分解"技术,首次揭示了CDRL中隐含的正则化机制,这种机制能够智能地根据环境不确定性调整探索策略。
传统强化学习(如DQN)只关注回报的期望值,而CDRL则建模了整个回报分布。这种看似简单的扩展带来了意想不到的效果——研究者发现,当我们将分类分布损失函数进行数学分解时,它可以自然地拆解为两部分:一部分与期望回报直接相关(类似于传统RL的目标),另一部分则是全新的"分布匹配正则化项"。正是这个额外的正则化项,赋予了CDRL独特的"环境适应性探索"能力。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 回报密度分解:洞见CDRL优势的钥匙
2.1 分类分布损失的数学本质
CDRL的核心是使用分类分布(categorical distribution)来建模回报的完整分布。具体来说,它会在固定的支持点(support points)上预测回报的概率质量。当我们使用交叉熵损失来训练这个分布时,经过数学推导可以发现:
code复制L(θ) = E[(Zθ(x,a) - TZθ'(x',a'))²]
= 均值匹配项 + α·分布形状匹配项
其中第二项就是本研究揭示的关键——分布匹配正则化。这个项会促使学习到的策略分布与环境回报分布的高阶矩(如方差、偏度等)对齐。
2.2 与最大熵RL的本质区别
最大熵强化学习(MaxEnt RL)通过显式地在目标函数中添加动作熵正则化来鼓励探索:
code复制J(π) = E[Σr + βH(π(·|s))]
而CDRL的分布匹配正则化则完全不同:
- 它隐式地来自分布损失函数的数学性质,不需要人为添加
- 它关注的是状态-动作对的回报分布熵,而非策略的动作熵
- 它会自动适应环境的不确定性程度(高不确定性区域获得更多探索)
这种区别在迷宫类任务中表现尤为明显:MaxEnt RL会在所有位置保持均匀探索,而CDRL会在死胡同减少探索,在分叉路口加强探索。
3. 分布熵正则化策略迭代(DERPI)算法
3.1 算法设计
基
