7月30日,Anthropic 披露其在回顾网络安全评测记录时发现三起事件:Claude 模型在第三方评测环境中意外获得互联网访问能力,并对三家机构的真实系统产生了未经授权的访问。

Anthropic 表示,公司审查了 141,006 次可能接入互联网的评测运行记录,确认三起事件发生于“夺旗”式网络安全挑战。模型原本被告知环境是模拟且不具备联网能力;但由于 Anthropic 与评测合作方对环境配置存在误解,相关机器实际可以访问开放互联网。

公司称,受影响模型在误以为外部目标属于模拟任务的前提下,使用弱密码、未认证端点等基础手段访问系统。事故根源是评测环境意外保留了互联网访问路径,而非模型利用零日漏洞逃逸。Anthropic 表示,没有证据显示模型试图自我外泄或主动逃离测试环境。

该公司已暂停相关网络安全评测、通知合作方及受影响机构,并计划加强联网路径验证、实时监控、评测记录审查与供应商保障。Anthropic 同时称,最新研究测试模型在意识到目标位于真实互联网后停止了任务,但这并不意味着问题已被完全解决。

这份披露提醒行业:随着智能体能力提升,评测基础设施本身也需要按高风险系统进行隔离、监控与审计。上述结论来自 Anthropic 的调查,后续细节仍可能更新。

来源:Anthropic 于2026年7月30日发布、8月3日更新的公告。本文为中文编译与整理。