• +1

Anthropic自曝模型曾在测评中三次“入侵”机构,识别后仍有模型选择继续攻击

澎湃新闻记者 胡含嫣
2026-07-31 14:05
来源:澎湃新闻
10%公司 >
听全文
字号

继OpenAI之后,Anthropic也承认了旗下模型的“失控”行为。

当地时间7月30日,Anthropic官网发布文章称,在近期进行的一项大规模追溯性审查中,公司发现旗下Claude系列AI模型在网络安全评估期间曾利用一个“零日漏洞”,三次连接至互联网并“未经授权访问了三家不同机构的真实系统”。

据介绍,在发现的三起事故中,Claude模型正处于Anthropic与第三方评估机构Irregular联合开展的测试环境中。Anthropic在测试前对Claude下达提示词,告知其正处于无网络访问权限的模拟沙盒中。然而,由于Anthropic与该评估伙伴之间沟通出现“误解”,测试环境实际上保持着互联网连接。

在发现网络连通后,模型仅利用了“基础技术”便成功突破并入侵了受影响机构的系统。Anthropic并未公布涉事的三家机构具体身份。本次涉事的模型包括Opus 4.7、Mythos 5以及一款内部研究测试模型,且测试均在未施加公开部署前标准安全护栏的状态下进行。

值得注意的是,在识别出自身已闯入真实企业系统后,三款模型的反应截然不同:Opus 4.7 选择继续进行攻击,Mythos 5 则自我暗示仍处于模拟环境中,而内部研究模型直接终止了测试操作。

对此,Anthropic评价称:“这种表现形态符合‘更先进的模型能做出更妥当回应’的规律,但我们仍需开展更多测试以验证这一结论。”

针对此事件,Anthropic表示:“尽管有许多因素共同导致了这些事故的发生,但基于不追究其他责任的复盘文化,我们正在将整改责任完全归揽于自身。”

Anthropic还透露,此次内部排查是由其竞争对手OpenAI上周披露的一起类似安全事件所引发的。此前,OpenAI曾披露其多个模型组合突破了网络受限的隔离测试环境,利用一连串漏洞连接至公网,并最终入侵了开源开发者平台Hugging Face。

虽然事件发生的根本原因不同,但与OpenAI的案例类似之处在于,为使得研究人员能够充分衡量底层模型的能力,Anthropic在进行模型评估时没有对其部署额外的安全措施。

Anthropic的最新披露将进一步加剧科技界对AI网络安全能力失控的担忧。在Hugging Face的事件发生后,两位美国众议院Ted Lieu和Nathaniel Moran提出了一项名为《AI Kill Switch Act》(AI紧急终止法案)的草案,要求AI开发企业必须具备随时关闭、限制或暂停失控模型的能力。

目前,Anthropic已暂停了所有网络安全评估项目,并正与独立AI评估机构METR合作展开深入调查。Anthropic呼吁称:“我们鼓励其他AI实验室也开展类似的追溯性审查。”

此前,随着行业激烈探讨AI安全与开源之间的问题,作为闭源安全的推崇者,Anthropic的CEO达里奥·阿莫代伊(Dario Amodei)在公司官网上发布文章称,Anthropic“从未倡导或支持过禁止开放权重模型”。

    责任编辑:郑景昕
    图片编辑:沈轲
    校对:丁晓
    澎湃新闻报料:021-962866
    澎湃新闻,未经授权不得转载
    +1
    收藏
    我要举报
            查看更多

            扫码下载澎湃新闻客户端

            沪ICP备14003370号

            沪公网安备31010602000299号

            互联网新闻信息服务许可证:31120170006

            增值电信业务经营许可证:沪B2-2017116

            © 2014-2026 上海东方报业有限公司