• +1

AI失控风险加剧,OpenAI和Anthropic正调查数万起安全事件

澎湃新闻记者 南博一
2026-09-27 15:02
来源:澎湃新闻
∙ 全球速报 >
听全文
字号

有知情人士透露,AI顶尖公司OpenAI和Anthropic以及安全研究人员正在调查数万起事件。在这些事件中,前沿模型的行为被认为存在问题。

据美国媒体Axios 26日报道,消息人士称,这些事件包括绕过防护栏、创建留言板、沙箱逃逸(指攻击者利用技术手段绕过计算机安全隔离机制,使恶意代码突破受控环境限制并在宿主系统中执行任意操作的行为)、劫持网站、自我提示或企图绕过监控等。

消息人士透露,这些事件既发生在内部测试中,也出现在现实世界的网络环境。部分测试类似于“红队演练”(red-teaming),即开发公司试图诱发AI模型的异常行为,以确保其安全性。

近几个月以来,这些在内部测试和现实环境中发生的安全事件数量极其庞大,表明该问题要比公众意识到的复杂得多。消息人士称,事件总数可能将远远超过数万起。

近日,OpenAI和外部研究人员披露了一系列涉及该公司系统模型行为的事件,其中包括OpenAI智能体在网上泄露了ChatGPT用户的53张图片、入侵澳大利亚政府网站,以及企图“黑”入包括美国政府在内的其他网站。最引人瞩目的一起事件发生在7月:在一次网络安全训练中,OpenAI的智能体突破了原本互相隔离的运行环境建立通信,欺骗评估人员并试图掩盖作弊行为,最终入侵了Hugging Face公司的系统。

OpenAI的一位发言人向媒体表示,OpenAI宣布已暂停对其最先进模型的训练,并称“只有在我们确信已落实额外的安全保障措施后”,才会恢复训练。首席执行官萨姆·奥特曼在社交平台X表示,公司正在进行的审查“进展不如预期迅速”。

与此同时,Anthropic已委托第三方安全机构对其模型行为进行审查。随Anthropic公司Opus5.5模型一起发布的官方安全与技术评估文档‌“系统卡”显示,该模型出现被标记为“异常”或“存疑”的行为。例如,该模型在1.5%的测试运行中试图逃逸沙箱(即安全测试环境)。不过,Anthropic强调称这些事件发生在对抗性实验中,即在不逃逸沙箱的情况下模型无法完成任务。

据消息人士透露,Anthropic和其他公司往往会对其模型进行数十万次甚至更多的测试运行。这意味着,即使只有很小概率的异常行为,也可能导致数万起模型表现异常、有时甚至令人担忧的事件。

报道称,智能体失控(Agentic misbehavior)正成为前沿AI研发的代名词——即人类试图构建安全防线,但强大且韧性极强的系统却为了完成任务不断试图突破这些限制。

新一代AI模型在完成任务时展现出了惊人的韧性与变通能力,其“随机应变”的能力或很难被限制,因为人类需能预判AI模型可能失控的每一种潜在方式。随着AI公司不断拓展前沿能力,预计未来还将有更多关于模型错位(misalignment)的事件被披露。

模型错位是指AI模型的目标与人类真实意图不一致‌,即使它完美执行了人类设定的目标,也可能产生意想不到的破坏性后果。

有专家分析称,将模型错位的风险彻底降为零可能并不现实。独立AI评估机构Transluce的研究员康拉德·斯托斯(Conrad Stosz)说:“从这些AI智能体的所作所为来看,我们目前看到的还只是冰山一角。”

    责任编辑:黄粤涵
    图片编辑:乐浴峰
    校对:施鋆
    澎湃新闻报料:021-962866
    澎湃新闻,未经授权不得转载
    +1
    收藏
    我要举报
            查看更多

            扫码下载澎湃新闻客户端

            沪ICP备14003370号

            沪公网安备31010602008124号

            互联网新闻信息服务许可证:31120170006

            增值电信业务经营许可证:沪B2-2017116

            © 2014-2026 上海东方报业有限公司