1. 强化学习基础:贝尔曼方程的核心地位
强化学习作为机器学习的重要分支,其核心问题可以归结为:智能体如何在与环境交互的过程中,通过试错学习最优策略。而这一切的理论基础,都建立在贝尔曼方程之上。
贝尔曼方程揭示了价值函数的递归特性,它告诉我们:当前状态的价值由即时奖励和后续状态的折扣价值共同决定。这个看似简单的数学表达,却蕴含着强化学习的全部智慧。
1.1 贝尔曼期望方程的数学表达
对于一个给定的策略π,其状态价值函数v_π满足贝尔曼期望方程:
v_π(s) = Σ_a π(a|s) Σ_s' p(s'|s,a)[r(s,a,s') + γv_π(s')]
这个方程表明:状态s的价值等于在该状态下采取所有可能动作的期望回报,其中每个动作的回报又包含即时奖励和后续状态的折扣价值。
1.2 贝尔曼方程的三重理解视角
从数学角度看,贝尔曼方程是一个递归定义的函数方程。它建立了当前状态价值与后续状态价值之间的关系,为迭代求解提供了理论基础。
从算法角度看,贝尔曼方程给出了价值函数的更新规则。几乎所有强化学习算法都可以看作是在不同条件下求解这个方程的方法。
从工程角度看,贝尔曼方程揭示了强化学习问题的结构特性。它告诉我们价值函数具有"最优子结构"特性,这使得动态规划方法成为可能。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 经典求解方法:DP与MC的对比分析
2.1 动态规划(DP):基于模型的完美求解
动态规划方法假设我们拥有完整的环境模型,即知道状态转移概率p(s'|s,a)和奖励函数r(s,a,s')。在这种理想条件下,贝尔曼方程变成了一个可以通过迭代求解的线性方程组。
DP的核心算法包括:
- 策略迭代:交替进行策略评估和策略改进
- 价值迭代:直接迭代更新价值函数直至收敛
然而,DP方法有两个致命局限:
- 需要完整的环境模型,这在现实中往往不可得
- 计算复杂度随状态空间呈指数增长,遭遇"维度灾难"
2.2 蒙特卡洛(MC):基于采样的直接估计
蒙特卡洛方法采取了完全不同的思路:它不依赖环境模型,而是通过实际采样获得的轨迹来直接估计价值函数。MC方法的核心公式为:
V(s) = average(G_t | S_t = s)
其中G_t是从状态s开始到回合结束的实际回报。
MC方法的优势在于:
- 不需要环境模型
