← 回總覽

价值对齐是个伪概念

📅 2026-08-11 16:30 腾讯研究院 人工智能 2 分鐘 1281 字 評分: 90
AI 安全 价值对齐 AI 伦理 人工智能治理 技术哲学
📌 一句话摘要 本文挑战了 AI 领域主流的「价值对齐」概念,认为其在逻辑定义、主体代表性及交互方向上存在根本性缺陷,并提议将治理思路从工程化的「对齐」转向社会化的「审议」。 📝 详细摘要 文章通过剖析 OpenAI 超级对齐团队解散等现状,指出「价值对齐」并非一个可工程化解决的命题,而更像是一种缓解公众焦虑的「对齐剧场」。作者从三个维度论证了其伪概念属性:首先,价值本身具有多元性与不可通约性,无法被单一向量化,且存在性能下降的「对齐税」;其次,当前的对齐过程呈现出「价值代笔」的政治结构,即少数技术精英在缺乏广泛社会协商的情况下,代替全人类起草价值观;最后,AI 与人类的关系是双向塑形的,

📌 一句话摘要

本文挑战了 AI 领域主流的「价值对齐」概念,认为其在逻辑定义、主体代表性及交互方向上存在根本性缺陷,并提议将治理思路从工程化的「对齐」转向社会化的「审议」。

📝 详细摘要

文章通过剖析 OpenAI 超级对齐团队解散等现状,指出「价值对齐」并非一个可工程化解决的命题,而更像是一种缓解公众焦虑的「对齐剧场」。作者从三个维度论证了其伪概念属性:首先,价值本身具有多元性与不可通约性,无法被单一向量化,且存在性能下降的「对齐税」;其次,当前的对齐过程呈现出「价值代笔」的政治结构,即少数技术精英在缺乏广泛社会协商的情况下,代替全人类起草价值观;最后,AI 与人类的关系是双向塑形的,AI 的输出正在同质化人类的表达与价值观。最后,作者建议将治理思路从封闭的「对齐」转向开放的「审议」,通过去神秘化、去代笔化、去单向化与去剧场化,让 AI 治理回归社会政治讨论。

💡 主要观点

- 价值对齐在逻辑上难以通过工程化手段实现。 价值具有多元性且不可通约,现有的 RLHF 等技术只是将复杂的伦理判断压缩为偏好向量,且会带来性能下降的「对齐税」。

当前的对齐过程存在「价值代笔」的政治结构问题。 少数 AI 公司的高管在缺乏广泛社会协商的情况下,代替全人类为 AI 起草价值观,缺乏真正的程序正义与代表性。
AI 与人类的关系是双向的相互塑形过程。 AI 不仅是被动接受对齐的对象,其输出也在深度参与并重塑人类的价值观与表达方式,形成「回锅人类」现象。
应从「对齐」转向「审议」的治理思路。 提议将治理从封闭的工程动词转向开放的政治动词,通过去神秘化、去代笔化、去单向化与去剧场化,让利益相关方参与价值构造。

💬 文章金句

- 所谓价值对齐,可能就不是一个可被工程化解决的命题。它更像是一种社会需要的姿态,一种制度需要的符号。

  • 我把这种结构称为「价值代笔」,这是价值对齐运动的真实政治结构,即一群代笔人在替全人类、所有文明为 AI 起草价值观。
  • 对齐剧场的逻辑与其同构,它不为降低 AI 风险,而是降低人类对 AI 的焦虑。

📊 文章信息

AI 初评:90

来源:腾讯研究院

作者:腾讯研究院

分类:人工智能

语言:中文

阅读时间:20 分钟

字数:4920

标签: AI 安全, 价值对齐, AI 伦理, 人工智能治理, 技术哲学

阅读完整文章

查看原文 → 發佈: 2026-08-11 16:30:00 收錄: 2026-08-11 22:00:47

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。