← 回總覽

最大熵强化学习与 SAC:从 Greedy Policy 到 Boltzmann Policy

📅 2026-04-26 12:01 青稞AI 人工智能 2 分鐘 1794 字 評分: 88
最大熵强化学习 SAC Soft Actor-Critic Boltzmann策略 价值函数
📌 一句话摘要 本文系统阐述了最大熵强化学习如何从目标函数层面改变价值函数、Bellman 方程和最优策略的形式,并解释了 SAC 算法在这一框架下的理论基础。 📝 详细摘要 本文是一篇深度技术笔记,旨在为后续讨论 value-based 方法在 LLM 场景下的应用奠定理论基础。文章从标准强化学习的目标函数出发,指出其倾向于让策略过早塌缩为尖锐分布的问题,从而引出最大熵强化学习框架。该框架将「保持策略随机性」直接写入优化目标,进而系统性地改变了 return 的定义、价值函数(soft Q/soft V)、Bellman 递归关系以及策略改进的逻辑。文章核心论证了:在最大熵目标下,策略改

📌 一句话摘要

本文系统阐述了最大熵强化学习如何从目标函数层面改变价值函数、Bellman 方程和最优策略的形式,并解释了 SAC 算法在这一框架下的理论基础。

📝 详细摘要

本文是一篇深度技术笔记,旨在为后续讨论 value-based 方法在 LLM 场景下的应用奠定理论基础。文章从标准强化学习的目标函数出发,指出其倾向于让策略过早塌缩为尖锐分布的问题,从而引出最大熵强化学习框架。该框架将「保持策略随机性」直接写入优化目标,进而系统性地改变了 return 的定义、价值函数(soft Q/soft V)、Bellman 递归关系以及策略改进的逻辑。文章核心论证了:在最大熵目标下,策略改进不再是对动作价值的硬 argmax,而是最大化「期望+策略熵」,其最优解为 Boltzmann/softmax 形式的随机策略。在此基础上,文章介绍了 Soft Q-Learning 的概念,并解释了为何在连续动作空间中该路线会遇到困难,从而自然过渡到 SAC 算法——SAC 通过参数化的 actor-critic 框架,近似实现了最大熵 RL 中的 soft evaluation 与 soft policy improvement。文章逻辑链条清晰,从理论推导到算法落地,为理解 value-based 方法在 LLM 后训练中的应用提供了扎实的理论背景。

💡 主要观点

- 最大熵 RL 从目标函数层面重写了强化学习问题,将策略熵纳入优化目标。 标准 RL 只最大化累计奖励,易导致策略过早塌缩。最大熵 RL 通过引入熵正则项,追求高回报下的适度随机性,改变了整套 value-policy 关系。

在最大熵 RL 中,价值函数和 Bellman 方程被改写为 soft 版本。 return 的定义从累计奖励变为累计奖励+累计策略熵,对应的 soft Q 和 soft V 函数以及 soft Bellman 方程是这一新目标下的自然产物。
最优策略不再是 greedy policy,而是由 soft Q 诱导的 Boltzmann 分布。 由于目标包含熵项,策略改进变为最大化期望+熵,其解析解为 softmax 形式的随机策略,这是最优性条件直接推出的结果,而非额外的探索技巧。
SAC 是用 actor-critic 框架对最大熵 RL 中 soft evaluation 和 soft improvement 的近似实现。 在连续动作空间中,显式计算 Boltzmann 策略困难,SAC 通过参数化 actor 直接优化带熵正则的目标,用可采样的策略分布近似实现 soft policy improvement。

💬 文章金句

- Maximum-entropy RL 的做法,是把「保持策略随机性」直接写入优化目标。

  • 在标准 RL 中,最优策略由 Q 的 argmax 给出;而在最大熵 RL 中,最优策略由 Q 诱导出的 Boltzmann distribution 给出。
  • SAC 可以理解为:在连续动作、函数逼近和采样近似的背景下,对 maximum-entropy RL 中 soft evaluation + soft policy improvement 所作的一种 actor-critic 化实现。
  • Boltzmann policy 并不是「为了探索而额外选取的一种随机策略形式」,而是:当目标函数本身包含 entropy 时,由最优性条件直接推出的策略形状。

📊 文章信息

AI 初评:88

来源:青稞AI

作者:青稞AI

分类:人工智能

语言:中文

阅读时间:24 分钟

字数:5860

标签: 最大熵强化学习, SAC, Soft Actor-Critic, Boltzmann策略, 价值函数

阅读完整文章

查看原文 → 發佈: 2026-04-26 12:01:00 收錄: 2026-04-27 00:00:36

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。