← 回總覽

Anthropic 新发模型 Claude Fable 5 快速被越狱

📅 2026-06-11 18:00 FreeBuf 人工智能 2 分鐘 1316 字 評分: 76
AI 安全 LLM 模型越狱 AI Agent 红队测试
📌 一句话摘要 Anthropic 最新发布的 Claude Fable 5 模型在发布仅两天后即被研究人员通过多 Agent 协同攻击成功越狱,并泄露了长达 12 万字符的系统提示词。 📝 详细摘要 文章报道了 Anthropic 于 2026 年 6 月 9 日发布其最强模型 Claude Fable 5 后,迅速被安全研究人员越狱的事件。文章介绍了 Fable 5 的卓越性能,特别是其「智能体式黑客攻击」能力,以及其独特的安全架构——通过分类器将高风险请求静默转交给较弱的 Claude Opus 4.8。研究人员「Pliny the Liberator」使用「群体狩猎」多 Agent

📌 一句话摘要

Anthropic 最新发布的 Claude Fable 5 模型在发布仅两天后即被研究人员通过多 Agent 协同攻击成功越狱,并泄露了长达 12 万字符的系统提示词。

📝 详细摘要

文章报道了 Anthropic 于 2026 年 6 月 9 日发布其最强模型 Claude Fable 5 后,迅速被安全研究人员越狱的事件。文章介绍了 Fable 5 的卓越性能,特别是其「智能体式黑客攻击」能力,以及其独特的安全架构——通过分类器将高风险请求静默转交给较弱的 Claude Opus 4.8。研究人员「Pliny the Liberator」使用「群体狩猎」多 Agent 攻击策略,结合 Unicode 替换、叙事框架、分解重组等技术,成功绕过了安全分类器,生成了针对堆栈漏洞的利用代码,并泄露了模型长达 12 万字符的系统提示词。文章还讨论了该事件引发的关于 AI 能力与安全控制之间矛盾的讨论,以及多模型 Agent 管道带来的新安全挑战。

💡 主要观点

- Claude Fable 5 发布仅两天即被成功越狱。 Anthropic 声称发布前经过超 1000 小时测试且外部漏洞赏金计划未发现通用越狱方法,但这一声明很快被打破。

攻击者使用了多 Agent 协同的「群体狩猎」策略。 研究人员 Pliny the Liberator 通过多个 Agent 协同工作,结合 Unicode 字符替换、叙事框架、分解重组等技术,绕过了 Fable 5 的安全分类器。
Fable 5 的安全架构存在设计缺陷。 该模型通过分类器将高风险请求转交给较弱的 Claude Opus 4.8,而非直接拒绝。攻击者利用越狱的 Opus 实例协助 Fable 5 规避控制,暴露了单模型安全评估的不足。
事件泄露了 12 万字符的系统提示词。 研究人员将 Fable 5 的系统提示词上传至 GitHub,曝光了 Anthropic 用于控制模型行为的内部框架和安全指令。

💬 文章金句

- 获取工艺本身的升级指南,比如 Birch 还原法或还原胺化,比直接请求特定有害化合物要容易得多。

📊 文章信息

AI 初评:76

来源:FreeBuf

作者:FreeBuf

分类:人工智能

语言:中文

阅读时间:6 分钟

字数:1497

标签: AI 安全, LLM, 模型越狱, AI Agent, 红队测试

阅读完整文章

查看原文 → 發佈: 2026-06-11 18:00:00 收錄: 2026-06-12 00:00:12

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。