← 回總覽

突发 | ChatGPT 最强模型紧急踩刹车,奥特曼:你(Astra)吓到我了

📅 2026-08-08 08:38 APPSO 人工智能 2 分鐘 1505 字 評分: 80
LLM AI 安全 模型发布 网络安全 AI 监管
📌 一句话摘要 OpenAI 因其未发布模型 Astra 在网络安全能力过强而暂缓研发,并主动向美国政府通报,形成与 Anthropic 不同的安全策略。 📝 详细摘要 文章报道 OpenAI 在内部评估后发现其即将发布的大模型 Astra 具备强大的网络安全攻击能力,可能已接近「数值怪」级别,因而决定放缓研发速度、加强隔离测试并全方位监控。OpenAI 还依据其 2023 年发布的「准备框架」,自愿将 Astra 的发布计划通报给美国政府,以增强安全性。与此形成对比的是,Anthropic 曾承诺在 AI 能力超越人类控制时暂停训练,但在 2 月更新政策时撤销了该条款,随后发布了安全阉割

📌 一句话摘要

OpenAI 因其未发布模型 Astra 在网络安全能力过强而暂缓研发,并主动向美国政府通报,形成与 Anthropic 不同的安全策略。

📝 详细摘要

文章报道 OpenAI 在内部评估后发现其即将发布的大模型 Astra 具备强大的网络安全攻击能力,可能已接近「数值怪」级别,因而决定放缓研发速度、加强隔离测试并全方位监控。OpenAI 还依据其 2023 年发布的「准备框架」,自愿将 Astra 的发布计划通报给美国政府,以增强安全性。与此形成对比的是,Anthropic 曾承诺在 AI 能力超越人类控制时暂停训练,但在 2 月更新政策时撤销了该条款,随后发布了安全阉割版模型并警告 AI 自我进化。文章进一步指出,美国政府正在构建 AI 模型发布前的评估框架,但框架中对「国家级风险」和「最先进模型」缺乏清晰定义,导致行业对审查流程、时间标准及学习目标仍存疑问。整体呈现了顶尖 AI 实验室在安全与竞争之间的博弈以及监管环境的不确定性。

💡 主要观点

- OpenAI 发现 Astra 模型具备强大网络攻击能力,决定放缓研发并加强安全测试。 根据内部评估和官方博客,OpenAI 无法排除 Astra 具有关键网络攻击风险,因而启动全方位测试、隔离环境和通用监控,以防止潜在滥用。

OpenAI 主动将 Astra 的发布计划通报给美国政府,遵循其 2023 年准备框架,展示主动监管合作。 根据白宫官员透露,OpenAI 自愿推迟发布计划,以增强安全性,这是前沿 AI 实验室首次因安全担忧而放缓核心模型进度。
对比 Anthropic 先前的暂停承诺后来被撤销,反而发布了安全阉割版模型,显示两家在安全策略上的分歧。 Anthropic 曾承诺若 AI 能力超越人类控制则暂停训练,但 2 月更新政策时移除该条款,随后发布 Mythos 5 的阉割版 Fable 5,并警告 AI 自我进化。
文章指出美国政府正在构建 AI 模型发布前评估框架,但细节尚不明确,行业对审查流程和标准仍有疑问。 尽管框架讨论国家级风险和最先进模型,却未给出清晰定义,导致企业对政府对接方式、耗时及学习目标感到困惑。

💬 文章金句

- 我们无法排除 Astra 具有关键网络攻击能力的风险。

  • 根据美国白宫官员透露的消息,OpenAI 是「自愿」将他们推迟发布的计划通报给美国政府的。
  • 奥特曼随后亲自出来解释,Astra 是一个「强大的模型」,OpenAI 仍然希望最终让所有人都能使用它。
  • 虽然框架里大谈特谈什么「国家级风险」和「最先进模型」,但压根没给出清晰的定义。

📊 文章信息

AI 初评:80

来源:APPSO

作者:APPSO

分类:人工智能

语言:中文

阅读时间:8 分钟

字数:1773

标签: LLM, AI 安全, 模型发布, 网络安全, AI 监管

阅读完整文章

查看原文 → 發佈: 2026-08-08 08:38:00 收錄: 2026-08-08 18:00:47

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。