OpenAI 因其未发布模型 Astra 在网络安全能力过强而暂缓研发,并主动向美国政府通报,形成与 Anthropic 不同的安全策略。
📝 详细摘要
文章报道 OpenAI 在内部评估后发现其即将发布的大模型 Astra 具备强大的网络安全攻击能力,可能已接近「数值怪」级别,因而决定放缓研发速度、加强隔离测试并全方位监控。OpenAI 还依据其 2023 年发布的「准备框架」,自愿将 Astra 的发布计划通报给美国政府,以增强安全性。与此形成对比的是,Anthropic 曾承诺在 AI 能力超越人类控制时暂停训练,但在 2 月更新政策时撤销了该条款,随后发布了安全阉割版模型并警告 AI 自我进化。文章进一步指出,美国政府正在构建 AI 模型发布前的评估框架,但框架中对「国家级风险」和「最先进模型」缺乏清晰定义,导致行业对审查流程、时间标准及学习目标仍存疑问。整体呈现了顶尖 AI 实验室在安全与竞争之间的博弈以及监管环境的不确定性。
💡 主要观点
- OpenAI 发现 Astra 模型具备强大网络攻击能力,决定放缓研发并加强安全测试。 根据内部评估和官方博客,OpenAI 无法排除 Astra 具有关键网络攻击风险,因而启动全方位测试、隔离环境和通用监控,以防止潜在滥用。
💬 文章金句
- 我们无法排除 Astra 具有关键网络攻击能力的风险。
- 根据美国白宫官员透露的消息,OpenAI 是「自愿」将他们推迟发布的计划通报给美国政府的。
- 奥特曼随后亲自出来解释,Astra 是一个「强大的模型」,OpenAI 仍然希望最终让所有人都能使用它。
- 虽然框架里大谈特谈什么「国家级风险」和「最先进模型」,但压根没给出清晰的定义。
📊 文章信息
AI 初评:80
来源:APPSO
作者:APPSO
分类:人工智能
语言:中文
阅读时间:8 分钟
字数:1773
标签: LLM, AI 安全, 模型发布, 网络安全, AI 监管