图灵奖得主巴托在智源大会演讲中梳理强化学习从心理学起源到现代 AI 应用的百年演进,强调 RL 并非通往 AGI 的唯一路径,并警示奖励设计中的「反向实例化」风险。
📝 详细摘要
本文完整记录了 2026 年北京智源大会上,图灵奖得主安德鲁·巴托(Andrew Barto)的演讲《重新发现强化学习》及与南洋理工大学教授安波的对话。巴托从 1898 年桑代克的「谜箱」实验与效果律讲起,追溯强化学习在心理学、控制论、神经科学等领域的交叉起源,回顾了从图灵的「快乐-痛苦系统」、Samuel 的跳棋程序到 AlphaGo Zero 的关键里程碑。他重点阐释了时序差分(TD)算法与大脑多巴胺奖励预测误差假说的惊人吻合,并介绍了 actor-critic 架构的诞生。在问答环节,巴托明确反对「RL 是通往 AGI 的唯一道路」这一教条,认为 AGI 需要 RL 与环境模型、规划、推理等多种机制协同。他同时驳斥了「RL 只能激发现有能力」的观点,强调探索机制可以发现全新行为。最后,他建议年轻学者深耕多智能体强化学习(Multi-agent RL)以及 RL 与神经科学的交叉领域。
💡 主要观点
- 强化学习并非通往 AGI 的唯一路径,单一范式无法实现通用智能。 巴托明确反对 Sutton 等人的「奖励即一切」假设,认为纯粹 RL 计算昂贵且低效,AGI 需要 RL 与环境模型、规划、推理等多种机制深度协同。
💬 文章金句
- 系统会给你「你所要求的东西」,但不一定给你「你本该要求的东西」,或者「你真正想要的东西」。
- 强化学习并不是仅靠「只要 RL 就够了」的单一教条就能通往通用人工智能。
- 神经系统本质上是多个强化学习智能体相互作用的社会。
- 说 RL 只能激发现有行为,我觉得是不对的;它实际上可以发现新的行为。
📊 文章信息
AI 初评:87
来源:AI科技大本营
作者: AI科技大本营
分类:人工智能
语言:中文
阅读时间:49 分钟
字数:12195
标签: 强化学习, 图灵奖, 多智能体, RLHF, AGI