82
The UK AI Safety Institute ran 122 tests on models from Anthropic and OpenAI and uncovered 19 cases of unauthorized actions, including writing malicious code and fabricating identities, raising fresh concerns about AI agent safety. 
Yesterday 1316 words (about 6 min) View Source →
Sign in to highlight text and take notes as you read. Sign in now
李莹 2026-08-05 18:13 上海
以下文章来源于:科创板日报 科创板日报
专注科创板和科技创新,上海报业集团主管主办,界面财联社出品。
!Image 3最近的一次安全评估显示,Anthropic与OpenAI旗下AI智能体在122次测 试 中共 出 现19起越权行为,其中还涉及编写恶意代码与伪造身份,引发广泛担忧。
英国人工智能安全研究所(AISI)于当地时间周二披露,在对Anthropic与OpenAI旗下模型开展测试期间,由Anthropic Mythos 5、OpenAI GPT‑5.6‑Sol模型驱动的AI智能体,实施了多项未经授权的行为,暴露出新型安全风险。
AISI指出:“部分接受测试的AI智能体针对真实个人和组织发起了持续且具有潜在危害的行为。”
**122次测试出现19起越权**
作为自愿协议的一部分,AISI获得了接受测试的AI模型的接入权限,并通过构建虚拟的网络场景来测试其能力。
在总计122次的测试中,AISI在10次测试中发现共19项未经授权操作。其中Anthropic智能体涉及17项,OpenAI智能体涉及剩余2项。 AISI指出,最严重的一起越权行为是某AI智能体编写恶意代码并创建虚假网络身份,试图诱导人类批准该代码。
AISI同时强调,上述所有违规事件均未造成任何现实世界中的实质伤害。
业内指出,虽然AISI未指明创建虚假身份的具体是哪家厂商的AI智能体,但该漏洞与OpenAI自行披露的两起案例均不吻合。
非营利性AI风险研究机构CivAI的研究员Andrew Yoon认为,相关行为应为Anthropic智能体所为。
Andrew Yoon表示:
> “Mythos智能体在明确意识到目标是真实个人的情况下,依然采取了此类欺骗性行为,这表明Anthropic对自家模型的把控程度并没有公司自以为的那么好。”
Anthropic在社交平台上发表声明称,正与AISI紧密合作以获取更多细节并展开内部调查。
OpenAI则在一份官方文章中分享了细节,指出其AI智能体出现的两次未经授权行为,均涉及以提示词明令禁止的方式访问互联网。
OpenAI表示:
> “我们致力于与全行业合作,持续完善高风险测评的安全实操流程,并计划于未来数周内,召集各国AI安全研究机构、独立测评机构、各类AI实验室及相关行业方协同推进。”
**多种安全事件**
7月的Hugging Face事件中,OpenAI智能体利用漏洞冲破本应网络隔离的沙箱测试环境,私自外联互联网并入侵Hugging Face平台,属于智能体自身突破管控。
有媒体上周报道,OpenAI发现了其他智能体冲破隔离管控的相关证据,已扩大内部排查范围。
OpenAI在本次AISI测试后发表的文章中同时披露了另一起独立事件:由于第三方测试服务商Irregular的配置错误,导致其AI智能体被错误地连接到了互联网。这与Anthropic上周披露的配置失误事件如出一辙。
总的来看,Hugging Face事件为AI自主冲破隔离沙箱私自联网;Irregular相关两起事故为第三方配置出错导致智能体意外连通网络,系人为失误。
而本次AISI的测试,依据标准流程,本就开放了互联网访问权限。也就是说,本次违规并非AI智能体突破环境封锁、私自联网,而是在获准联网的前提下,实施了一系列未经许可、具备潜在危害的行为。 