← 回總覽

图灵奖得主本吉奥警告:当前的安全措施,追不上 AI 能力的狂飙

📅 2026-07-17 23:39 腾讯科技 人工智能 2 分鐘 1408 字 評分: 88
AI安全与对齐 AI治理 前沿AI WAIC 图灵奖
📌 一句话摘要 本文报道 WAIC 2026 上本吉奥、周伯文等专家对 AI 安全风险加剧的警告,分析传统安全护栏失效、内生安全路径、编程与科研能力反差以及治理分歧。 📝 详细摘要 文章基于 2026 年世界人工智能大会科学前沿论坛的演讲与圆桌讨论,呈现了多位重量级学者对 AI 安全挑战的深度剖析。图灵奖得主本吉奥远程警告 AI 正从两个方向为恶意行为者赋能,既降低作恶门槛又抬高风险上限,而当前安全措施已追不上能力跃迁。西安电子科技大学校长高新波指出传统“补丁思维”安全护栏因 AI 推理与规划能力而系统性失效,提出向“内生安全”转变。上海人工智能实验室主任周伯文揭示一组关键反差:AI 编程

📌 一句话摘要

本文报道 WAIC 2026 上本吉奥、周伯文等专家对 AI 安全风险加剧的警告,分析传统安全护栏失效、内生安全路径、编程与科研能力反差以及治理分歧。

📝 详细摘要

文章基于 2026 年世界人工智能大会科学前沿论坛的演讲与圆桌讨论,呈现了多位重量级学者对 AI 安全挑战的深度剖析。图灵奖得主本吉奥远程警告 AI 正从两个方向为恶意行为者赋能,既降低作恶门槛又抬高风险上限,而当前安全措施已追不上能力跃迁。西安电子科技大学校长高新波指出传统“补丁思维”安全护栏因 AI 推理与规划能力而系统性失效,提出向“内生安全”转变。上海人工智能实验室主任周伯文揭示一组关键反差:AI 编程成功率 18 个月从 5%飙升至 88%,但科研发现完成率仅 3%,认为科学任务是 AI 的终极考题,其要求与安全治理内在一致。圆桌讨论还涉及 CBRN 生物风险、开源与闭源安全权衡、证据困境(能力已强到令人不安却无硬证据立即干预)以及安全价值即商业价值等观点。整体上,文章既呈现了世界级 AI 安全研究者的前沿判断,也综合了中国学者的务实回应,信息密度高、观点多元。

💡 主要观点

- 传统 AI 安全护栏在模型具备推理与规划能力后系统性失效。 高新波指出 AI 依靠“补丁思维”打补丁的方式已无法应对精准越狱、战略性欺骗、复杂工具调用语义副作用以及涌现综合行为,必须转向“内生安全”。

AI 编程能力飙升但科学发现能力停滞,反映安全治理的核心难点。 周伯文揭示编程成功率 88%但科研完成率仅 3%的反差,认为原因在于模型仅学习相关性而非因果性、科研反馈周期长、训练数据只有成功经验,而这与开放域安全挑战的难度本质一致。
AI 风险治理存在“证据困境”,需要默认预防姿态。 明德曼指出 AI 能力常跳跃式提升,但风险变成现实前难拿到确凿证据;Anthropic 曾因模型能力突增担忧网络攻击却无法证明“一定会出事”而自愿暂缓发布。本吉奥呼吁能力跃升前必须做好准备。
关于开源与安全,存在激进警告与务实平衡的分歧。 本吉奥强调开源模型一旦发布不可逆转;国内学者则认可开源红利,认为核心应重构安全架构(如内核闭源+外围开源),而非全盘闭源。

💬 文章金句

- AI 既降低了作恶的门槛,又抬高了危害的上限。

  • 在模型能力出现跃升之前做好准备,必须成为默认姿态。
  • 安全价值就是商业价值,它们并不对立。

📊 文章信息

AI 初评:88

来源:腾讯科技

作者:腾讯科技

分类:人工智能

语言:中文

阅读时间:19 分钟

字数:4593

标签: AI安全与对齐, AI治理, 前沿AI, WAIC, 图灵奖

阅读完整文章

查看原文 → 發佈: 2026-07-17 23:39:00 收錄: 2026-07-18 10:00:50

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。