本文报道 WAIC 2026 上本吉奥、周伯文等专家对 AI 安全风险加剧的警告,分析传统安全护栏失效、内生安全路径、编程与科研能力反差以及治理分歧。
📝 详细摘要
文章基于 2026 年世界人工智能大会科学前沿论坛的演讲与圆桌讨论,呈现了多位重量级学者对 AI 安全挑战的深度剖析。图灵奖得主本吉奥远程警告 AI 正从两个方向为恶意行为者赋能,既降低作恶门槛又抬高风险上限,而当前安全措施已追不上能力跃迁。西安电子科技大学校长高新波指出传统“补丁思维”安全护栏因 AI 推理与规划能力而系统性失效,提出向“内生安全”转变。上海人工智能实验室主任周伯文揭示一组关键反差:AI 编程成功率 18 个月从 5%飙升至 88%,但科研发现完成率仅 3%,认为科学任务是 AI 的终极考题,其要求与安全治理内在一致。圆桌讨论还涉及 CBRN 生物风险、开源与闭源安全权衡、证据困境(能力已强到令人不安却无硬证据立即干预)以及安全价值即商业价值等观点。整体上,文章既呈现了世界级 AI 安全研究者的前沿判断,也综合了中国学者的务实回应,信息密度高、观点多元。
💡 主要观点
- 传统 AI 安全护栏在模型具备推理与规划能力后系统性失效。 高新波指出 AI 依靠“补丁思维”打补丁的方式已无法应对精准越狱、战略性欺骗、复杂工具调用语义副作用以及涌现综合行为,必须转向“内生安全”。
💬 文章金句
- AI 既降低了作恶的门槛,又抬高了危害的上限。
- 在模型能力出现跃升之前做好准备,必须成为默认姿态。
- 安全价值就是商业价值,它们并不对立。
📊 文章信息
AI 初评:88
来源:腾讯科技
作者:腾讯科技
分类:人工智能
语言:中文
阅读时间:19 分钟
字数:4593
标签: AI安全与对齐, AI治理, 前沿AI, WAIC, 图灵奖