← 回總覽

GPT-5.6 终于来了,但是又被加了“白宫安全锁”

📅 2026-06-27 09:06 腾讯科技 人工智能 2 分鐘 1525 字 評分: 86
大语言模型 AI 安全 模型发布 AI 能力评测 政策监管
📌 一句话摘要 OpenAI 发布 GPT-5.6 系列三款模型,全系因网络安全与生物能力被标注为高风险,需分阶段向可信用户开放,同时引入超极模式等关键技术升级。 📝 详细摘要 文章详细报道了 OpenAI 于 2026 年 6 月 27 日发布的 GPT-5.6 系列模型,包括旗舰 Sol、商业平衡版 Terra 和轻量版 Luna。新命名体系使不同层级可按各自节奏迭代。全系模型在网络安全和生物化学领域被首次标注为高风险,内部夺旗测试和病毒学评估均显示能力跨越关键阈值,OpenAI 因此采取分阶段发布策略,仅向经政府认可的可信合作伙伴开放。技术亮点是 Sol 引入的超极模式,通过子智能体

📌 一句话摘要

OpenAI 发布 GPT-5.6 系列三款模型,全系因网络安全与生物能力被标注为高风险,需分阶段向可信用户开放,同时引入超极模式等关键技术升级。

📝 详细摘要

文章详细报道了 OpenAI 于 2026 年 6 月 27 日发布的 GPT-5.6 系列模型,包括旗舰 Sol、商业平衡版 Terra 和轻量版 Luna。新命名体系使不同层级可按各自节奏迭代。全系模型在网络安全和生物化学领域被首次标注为高风险,内部夺旗测试和病毒学评估均显示能力跨越关键阈值,OpenAI 因此采取分阶段发布策略,仅向经政府认可的可信合作伙伴开放。技术亮点是 Sol 引入的超极模式,通过子智能体拆解复杂任务,在 Terminal-Bench 2.1 上创下 91.9% 的新纪录,且在 ExploitBench 上用仅约三分之一的输出 token 达到与 Anthropic 竞品相近的水平。文章还分析了发布节奏背后的政策博弈,包括特朗普签署的 AI 行政命令以及 Anthropic 模型被限制出口的背景。

💡 主要观点

- GPT-5.6 系列首次采用 Sol/Terra/Luna 分层命名,代际与能力层级解耦。 数字代表代际,名称代表能力层级,各层级独立迭代,解决此前 nano/mini 区分度不足的问题。Sol 为旗舰,Terra 平衡性能与成本,Luna 追求速度与经济性。

全系模型首次在网络安全与生物领域被列为高风险,能力系统性跃升。 即使最轻量的 Luna 在夺旗测试中也越过 OpenAI 内部高风险门槛;Sol 在病毒学故障排除测试中得分 55.5%,远超专家阈值 31%,但关键生物设计阈值未触及。
Sol 的超极模式通过子智能体并行拆解任务,大幅提升复杂任务效率。 Terminal-Bench 2.1 得分 91.9%,显著领先 GPT-5.5 和竞品;在 GeneBench 上用更少的 token 获得更高分数,推理效率与精度同步改善。
分阶段发布源于美国政府审查,OpenAI 认为此流程不应成为常态。 OpenAI 在发布前已向政府展示能力,应要求先向可信合作伙伴开放。CEO 奥特曼与商务部长沟通后执行,但 OpenAI 明确表示长期来看会阻碍工具到达真正需要的用户。

💬 文章金句

- 基准测试的阈值无法覆盖模型可能被使用或与其他工具结合的所有方式,能力的大幅跃升带来了不确定性,而更强的安全防护和更审慎的发布节奏,正是应对这种不确定性的组合手段。

  • OpenAI 表示,这种政府接入流程不应成为长期的默认做法,「它会让最好的工具无法到达真正需要的用户、开发者、企业和网络防御者手里。」

📊 文章信息

AI 初评:86

来源:腾讯科技

作者:腾讯科技

分类:人工智能

语言:中文

阅读时间:18 分钟

字数:4499

标签: 大语言模型, AI 安全, 模型发布, AI 能力评测, 政策监管

阅读完整文章

查看原文 → 發佈: 2026-06-27 09:06:00 收錄: 2026-06-27 16:00:40

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。