SuperPortia Reading
總覽
文章
簡報
🔍 搜尋
全部
未讀 (40071)
★ 收藏 (0)
🤖 人工智能 (14612)
📊 商业科技 (6978)
📁 媒体资讯 (5897)
📁 投资财经 (3718)
📁 生活文化 (3124)
💻 软件编程 (2081)
📁 个人成长 (2004)
📁 体育运动 (1051)
🎨 产品设计 (554)
📁 AI 产品 (39)
篩選中:
🏷️ THUNLP
共 1 篇
✕ 清除篩選
40073
全部文章
40071
未讀
186
今日新增
0
收藏
📡 Poller
最後抓取:
1 小時前
(08-14 18:00)
BestBlogs 精選 (40000)
🏷️ 熱門標籤
AI Agent
3286
政策解读
1748
投资与市场
1528
宏观经济
1417
AI 编程
1379
产业动态
1355
国际新闻
1273
LLM
1193
社会议题
1108
Anthropic
1098
国内新闻
1064
Claude Code
1046
地缘政治
1005
科技新闻
924
OpenAI
906
AI 智能体
789
生活方式
768
个人成长
709
具身智能
708
足球
702
●
影响 OPD work 的因素有哪些?聊聊 Rethinking OPD 这一路
📌 一句话摘要 本文深入分析了影响 On-Policy Distillation (OPD) 效果的关键因素,包括思维模式匹配、信息增益和跨尺寸蒸馏的挑战,并提出了冷启动和提示选择等实用干预策略。 📝 详细摘要 文章基于清华大学 THUNLP 团队的最新研究,系统探讨了 OPD 在 LLM 训练
📅 2026-04-25 00:00
(04-25 00:00)
青稞AI
人工智能
2 分鐘
★ 87
On-Policy Distillation
LLM 训练
知识蒸馏
强化学习