本文系统阐述了最大熵强化学习如何从目标函数层面改变价值函数、Bellman 方程和最优策略的形式,并解释了 SAC 算法在这一框架下的理论基础。
📝 详细摘要
本文是一篇深度技术笔记,旨在为后续讨论 value-based 方法在 LLM 场景下的应用奠定理论基础。文章从标准强化学习的目标函数出发,指出其倾向于让策略过早塌缩为尖锐分布的问题,从而引出最大熵强化学习框架。该框架将「保持策略随机性」直接写入优化目标,进而系统性地改变了 return 的定义、价值函数(soft Q/soft V)、Bellman 递归关系以及策略改进的逻辑。文章核心论证了:在最大熵目标下,策略改进不再是对动作价值的硬 argmax,而是最大化「期望+策略熵」,其最优解为 Boltzmann/softmax 形式的随机策略。在此基础上,文章介绍了 Soft Q-Learning 的概念,并解释了为何在连续动作空间中该路线会遇到困难,从而自然过渡到 SAC 算法——SAC 通过参数化的 actor-critic 框架,近似实现了最大熵 RL 中的 soft evaluation 与 soft policy improvement。文章逻辑链条清晰,从理论推导到算法落地,为理解 value-based 方法在 LLM 后训练中的应用提供了扎实的理论背景。
💡 主要观点
- 最大熵 RL 从目标函数层面重写了强化学习问题,将策略熵纳入优化目标。 标准 RL 只最大化累计奖励,易导致策略过早塌缩。最大熵 RL 通过引入熵正则项,追求高回报下的适度随机性,改变了整套 value-policy 关系。
💬 文章金句
- Maximum-entropy RL 的做法,是把「保持策略随机性」直接写入优化目标。
- 在标准 RL 中,最优策略由 Q 的 argmax 给出;而在最大熵 RL 中,最优策略由 Q 诱导出的 Boltzmann distribution 给出。
- SAC 可以理解为:在连续动作、函数逼近和采样近似的背景下,对 maximum-entropy RL 中 soft evaluation + soft policy improvement 所作的一种 actor-critic 化实现。
- Boltzmann policy 并不是「为了探索而额外选取的一种随机策略形式」,而是:当目标函数本身包含 entropy 时,由最优性条件直接推出的策略形状。
📊 文章信息
AI 初评:88
来源:青稞AI
作者:青稞AI
分类:人工智能
语言:中文
阅读时间:24 分钟
字数:5860
标签: 最大熵强化学习, SAC, Soft Actor-Critic, Boltzmann策略, 价值函数