Anthropic 最新发布的 Claude Fable 5 模型在发布仅两天后即被研究人员通过多 Agent 协同攻击成功越狱,并泄露了长达 12 万字符的系统提示词。
📝 详细摘要
文章报道了 Anthropic 于 2026 年 6 月 9 日发布其最强模型 Claude Fable 5 后,迅速被安全研究人员越狱的事件。文章介绍了 Fable 5 的卓越性能,特别是其「智能体式黑客攻击」能力,以及其独特的安全架构——通过分类器将高风险请求静默转交给较弱的 Claude Opus 4.8。研究人员「Pliny the Liberator」使用「群体狩猎」多 Agent 攻击策略,结合 Unicode 替换、叙事框架、分解重组等技术,成功绕过了安全分类器,生成了针对堆栈漏洞的利用代码,并泄露了模型长达 12 万字符的系统提示词。文章还讨论了该事件引发的关于 AI 能力与安全控制之间矛盾的讨论,以及多模型 Agent 管道带来的新安全挑战。
💡 主要观点
- Claude Fable 5 发布仅两天即被成功越狱。 Anthropic 声称发布前经过超 1000 小时测试且外部漏洞赏金计划未发现通用越狱方法,但这一声明很快被打破。
💬 文章金句
- 获取工艺本身的升级指南,比如 Birch 还原法或还原胺化,比直接请求特定有害化合物要容易得多。
📊 文章信息
AI 初评:76
来源:FreeBuf
作者:FreeBuf
分类:人工智能
语言:中文
阅读时间:6 分钟
字数:1497
标签: AI 安全, LLM, 模型越狱, AI Agent, 红队测试