← 回總覽

ACL 2026 | 腾讯混元发现「不完全学习」,SFT 仍漏学 15%训练数据

📅 2026-06-19 14:44 PaperWeekly 人工智能 2 分鐘 1503 字 評分: 88
LLM SFT 模型训练与推理 AI 研究 ACL 2026
📌 一句话摘要 腾讯混元与 UNSW 联合团队在 ACL 2026 发表论文,系统性地揭示了 SFT 后模型平均仍有 15.3% 训练样本未被有效学习的「不完全学习」现象,并提出了检测、归因与干预的完整框架。 📝 详细摘要 本文解读了腾讯混元与 UNSW 联合团队在 ACL 2026 上发表的论文,该论文首次系统性地研究了 SFT 中的「不完全学习现象」(ILP)。核心发现是,即使 SFT 训练已收敛,模型在训练集上重新测试时,平均仍有 15.3% ± 2.1% 的样本未能正确回答。这些未学习样本并非随机分布,而是系统性地集中在涉及罕见实体、多步推理、与预训练知识冲突的复杂样本上。论文将

📌 一句话摘要

腾讯混元与 UNSW 联合团队在 ACL 2026 发表论文,系统性地揭示了 SFT 后模型平均仍有 15.3% 训练样本未被有效学习的「不完全学习」现象,并提出了检测、归因与干预的完整框架。

📝 详细摘要

本文解读了腾讯混元与 UNSW 联合团队在 ACL 2026 上发表的论文,该论文首次系统性地研究了 SFT 中的「不完全学习现象」(ILP)。核心发现是,即使 SFT 训练已收敛,模型在训练集上重新测试时,平均仍有 15.3% ± 2.1% 的样本未能正确回答。这些未学习样本并非随机分布,而是系统性地集中在涉及罕见实体、多步推理、与预训练知识冲突的复杂样本上。论文将 ILP 归因于五大根因:基模型知识缺失、预训练知识冲突、数据自身矛盾、多任务训练顺序不当、以及简单样本梯度主导。针对每种病因,作者提出了相应的干预策略,如针对知识缺失的持续预训练(CPT)。文章还指出,CPT 虽能精准修复知识冲突,但可能暂时损害通用能力,需谨慎使用。最后,文章为从业者提供了可操作的实践建议,如重新测试训练集、检查数据矛盾、优化数据顺序等。

💡 主要观点

- SFT 收敛后,平均仍有 15.3% 的训练样本未被模型有效学习。 论文通过精心设计的检测协议,在 10 个标准 SFT 数据集上发现,模型在训练集上重新测试时,平均有 15.3% 的样本答错,且该比例在不同模型和数据上惊人地稳定。

未学习样本系统性地集中在复杂、高价值的样本上。 涉及罕见实体、多步组合推理、与预训练知识冲突的样本未学习率高达 19%-23%,而简单陈述性知识仅为 8.1%,这意味着模型「选择性放弃」了最有价值的训练数据。
ILP 的五大根因被识别,包括知识缺失、知识冲突、数据矛盾、训练顺序和梯度主导。 论文将 ILP 归因于五个可操作的原因:基模型知识缺失、预训练知识冲突、数据内部矛盾、多任务训练顺序导致的遗忘、以及简单样本梯度累积掩盖了难样本的贡献。
针对不同病因的干预策略有效,但需精准使用。 例如,持续预训练(CPT)可有效修复知识缺失和冲突,但可能暂时损害通用 benchmark 性能,表明 CPT 是「手术刀」而非「补药」,需要后续 SFT 重新调和。

💬 文章金句

- 即使 SFT 训练已收敛、loss 已平稳、所有超参都调无可调,你的模型在训练集上重新测试——仍然有平均 15.3% 的样本答不对。

  • 未学习样本不是随机的。它们系统性地集中在……涉及罕见实体/低频知识、需要多步组合推理、与预训练知识冲突。
  • CPT 是手术刀,不是补药。

📊 文章信息

AI 初评:88

来源:PaperWeekly

作者:PaperWeekly

分类:人工智能

语言:中文

阅读时间:9 分钟

字数:2156

标签: LLM, SFT, 模型训练与推理, AI 研究, ACL 2026

阅读完整文章

查看原文 → 發佈: 2026-06-19 14:44:00 收錄: 2026-06-19 22:00:52

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。