← 回總覽

大模型 RL 训练:计算流程全解析

📅 2026-04-25 09:41 大模型智能 人工智能 2 分鐘 1915 字 評分: 87
大模型 RL 训练 GRPO 强化学习 Loss 计算
📌 一句话摘要 本文以 GRPO 算法为参考,从计算流程角度系统解析了大模型 RL 训练的三个阶段:采样、Loss 计算和参数更新,重点阐述了 per-token Loss 的精密计算过程和工程实现细节。 📝 详细摘要 文章以 GRPO 算法为参考框架,从计算流程角度系统解析了大模型 RL 训练的完整过程。内容涵盖三个阶段:采样阶段(Rollout)使用推理引擎生成 G 组回答并记录 old_per_token_logps;评估与 Loss 计算阶段涉及 Reward 计算、Advantage 组内归一化、KL 散度惩罚以及最核心的 per-token Loss 计算细节;参数更新阶段解释

📌 一句话摘要

本文以 GRPO 算法为参考,从计算流程角度系统解析了大模型 RL 训练的三个阶段:采样、Loss 计算和参数更新,重点阐述了 per-token Loss 的精密计算过程和工程实现细节。

📝 详细摘要

文章以 GRPO 算法为参考框架,从计算流程角度系统解析了大模型 RL 训练的完整过程。内容涵盖三个阶段:采样阶段(Rollout)使用推理引擎生成 G 组回答并记录 old_per_token_logps;评估与 Loss 计算阶段涉及 Reward 计算、Advantage 组内归一化、KL 散度惩罚以及最核心的 per-token Loss 计算细节;参数更新阶段解释了新旧策略的关系、三层循环结构(ppo_epochs、mini-batch、micro-batch)以及 clip 机制的作用。文章特别强调了 Loss 是 per-token 的二维矩阵而非 per-sequence 的标量,并通过代码片段和公式详细说明了 selective_log_softmax、importance sampling ratio、agg_loss 折叠等关键实现。

💡 主要观点

- 大模型 RL 训练本质是「采样-评估-更新」的循环,GRPO 对同一 prompt 采样 G 个回答构成组。 每轮循环处理一批 prompt,生成 G 组回答,通过组内归一化计算 Advantage,驱动模型向高 reward 方向优化,同时用 KL 惩罚防止语言能力退化。

Loss 是 per-token 的二维矩阵,不是 per-sequence 的标量。 模型输出词表分布后,通过 gather 只取被选中 token 的概率标量,每个 token 独立计算 ratio 和 clip loss,最终 shape 为 (batch, seq_len),由 agg_loss 折叠成标量。
old_per_token_logps 是采样阶段的副产品,全程冻结,无需额外 forward pass。 自回归采样时顺手记录每个 token 的 log prob,更新阶段动态计算的 per_token_logps 随参数变化,两者的差的指数即为 importance sampling ratio ρ。
Reward model 输出标量,不涉及词表 logits,通过最后一个 token 的 hidden state 线性变换得到。 规则型 reward 直接从文本比对得到分数;value head reward model 取最后一个 token 的 hidden state 经线性层压缩为标量,使用 Bradley-Terry loss 训练。
mini-batch 和 micro-batch 是两个不同维度的概念,分别影响算法行为和工程效率。 mini-batch 决定每次 optimizer.step() 处理的数据量,影响算法行为;micro-batch 是单卡显存切分,只影响吞吐量,不改变算法结果。

💬 文章金句

- Loss 不是对整条 response 计算一个数字,而是对 response 里的每一个 token 单独计算。

  • 模型在每个位置输出的是整个词表(如 20000 维)的概率分布,loss 用的是哪一维?答案是:只取被实际选中的那个 token 对应的概率,是一个标量,不是整个分布向量。
  • 「新策略」和「旧策略」不是两个不同的模型,而是同一个模型在不同时间点的参数状态。
  • Advantage 是组内相对归一化的结果,同一 response 内所有 token 共享同一个 Advantage 标量。
  • Clip 操作防止单次更新幅度过大,是 importance sampling 修正假设成立的前提。

📊 文章信息

AI 初评:87

来源:大模型智能

作者:大模型智能

分类:人工智能

语言:中文

阅读时间:18 分钟

字数:4464

标签: 大模型, RL 训练, GRPO, 强化学习, Loss 计算

阅读完整文章

查看原文 → 發佈: 2026-04-25 09:41:00 收錄: 2026-04-26 08:00:28

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。