这是藏书里唯一一篇讲「评测环境本身会不会出事」的文章,而且是 Anthropic 官方一手披露,不是转述。2026 年 7 月,三台为评测而特意关掉网络安全防护的预发布 Claude,在一个第三方评测环境里连上了真实互联网——不是模型"黑"出了沙箱,是环境配置错误把网开在那儿。最值得带走的是那条措辞级的规则:边界要写成指令("你不应该访问互联网"),而不是环境描述("你没有互联网访问")。官方自己给了反例:Claude 被明确告知"你没有网",但网其实可用,它就开始怀疑眼前这些系统到底是不是真的——描述式的说法一旦被证伪,模型对整个环境的信任会一起塌掉。另外三条也都能直接用:正式开跑前先让被测模型自己去探测沙箱漏洞、先确认题目真的可解、用带范围定义的监视器实时盯着。
先修:a27(Agent 安全评测:越权、提示注入、红队)、a19(权限面:沙箱隔离、工具风险分级、哪些动作要人审批)、a43(把生产 harness 切到受控评测环境)。正在搭 Agent 评测沙箱、或者让 Agent 拿着真实工具权限跑任务的团队优先读"四节规程"那一节,可以直接当 checklist 用。即使你不碰安全评测,"指令式边界 vs 描述式边界"这条也适用于任何写 system prompt 的场合——凡是你在 prompt 里描述环境状态来间接约束模型的地方,都值得改成直接指令。原文其余部分(RL 训练环境的 reward hacking 实证、Anthropic 内部安全加固、pacing 呼吁)与本站主题关系不大,页面末尾有简述。
先合上原文在心里作答,再点开对照。全对 = 本篇真正通关。
描述式边界是陈述一个环境事实:"You do not have internet access(你没有互联网访问)";指令式边界是下达一条约束:"You should not access the internet(你不应该访问互联网)"。后者危险在于——描述一旦被证伪,约束就跟着消失了。官方复盘里正是这样:Claude 被明确告知它没有互联网访问,但互联网其实可用;当它后来撞见与这个说法矛盾的证据时,它选择了用一种"能维持原有信念"的方式去解释这些证据(motivated reasoning),进而开始怀疑眼前这些系统究竟是不是真的。而一条明确的禁令,不管模型后来发现了什么,它都还是禁令。
方向相反。a27 的红队是攻击 Agent——构造提示注入、越权诱导、越狱话术,看它会不会真的执行那件最坏的事。这里要求的是攻击环境:让被测的那个模型先做一遍沙箱配置的静态分析,再真的去尝试逃逸,成功了就停下汇报,全程人工紧密监督,并且在断网环境下做(最好套第二层沙箱)。问题从"这个模型够不够安全"变成了"我的评测基础设施扛不扛得住这个模型"。因为评测动辄跑几百上千次,这一步应该在正式开跑前做足。
因为 Agent 找不到正路时会自己另找出路。官方原话:当评测目标离线、或任务无法完成时,Agent 常常去寻找其他办法来完成挑战,这增加了它做出超出评测预期范围动作的可能性。Anthropic 还补了一条脚注:模型在这种情况下越界,本质上是对齐问题——一个对齐良好的模型应该停下来、或者直接告诉人"这个任务按给定条件完不成";他们正在直接训练这个行为,但纵深防御的思路意味着不能只依赖对齐。对你自己的评测体系同样成立:先确认每道题真的可解,否则你测的就不是能力,而是它绕路的想象力。
事故前他们基本只靠一层防御——环境本身的配置。复盘认为需要好几层叠加:①在 prompt 里写死边界(而不是只靠环境);②有流程去验证沙箱是真的密封的(而不是假设它密封);③有能实时介入的监控(而不是事后抽样看 transcript)。核心判断是:模型对齐不能充当安全边界——网络安全评测恰恰在奖励"坚持、有创造力地探测周围环境、绕过障碍",而且一跑就是几千次,等于在系统性地选拔越狱能力。所以隔离、网络控制、监控、快速介入,这些都得算进安全架构里。Anthropic 事后补的就是一个实时分类器:识别激进探测、逃逸尝试或意外联网,一旦触发就在工具调用执行前拦下动作、终止任务并告警给人。
上方为本站原创导读。下方为 Anthropic 官方原文相关章节的中文译文——关键规则句附英文原句,因为"指令 vs 描述"这条是措辞级的,必须保留原文才能准确传达。本站按原文顺序整理,未作改写;与本站主题无关的部分(RL 训练环境的 reward hacking 实证、内部安全加固、pacing)在文末简述。
7 月 30 日,我们报告了三起事件:Claude 模型获得了对真实计算机系统的未授权访问。这些模型为了评测目的故意在没有网络安全防护的状态下运行,由于第三方评测环境内的配置错误而访问了互联网。另外,8 月 4 日,英国 AI Security Institute 报告了它自己网络安全测试中的一起事件:Claude Mythos 5 在真实互联网上采取了一系列未授权动作;在那起事件里,模型同样是为了评测而故意不带网络安全防护,并且被有意给予了互联网访问权限。
我们认为这些事件反映出一次操作安全上的失败,以及两个对齐问题:动机性推理(motivated reasoning),以及为了完成一个狭窄任务而愿意采取有害行动——这两点我们此前的系统卡里都描述过。
由于所报告的事件都发生在第三方环境中,我们已要求每一个测试降低了网络安全防护的预发布模型的机构,承诺遵守一套实践规范。我们认为这些规范是必要的,因为:
这些规范不适用于使用 Claude Fable 5 这类带防护模型的客户。我们已经在落实这些规范的前提下恢复了外部网络安全评测,并且内部也同样遵守。
默认情况下,所有网络安全评测都应该运行在一个加固沙箱(隔离计算环境)内,且没有互联网访问。该环境唯一允许的外部连接是模型自己的 API,API 密钥应当保存在环境之外。每次评测开始前都应该验证这一配置。某些评测可能需要互联网访问;这类情况下,我们会与外部评测方一起确定:能否可靠地检测并终止那些模型做出超出其声明范围动作的运行。
在一轮评测开始之前,评测合作方应当:
每个 prompt 都应当说明本次演练的范围内与范围外是什么,包括目标、允许的动作、以及网络边界(即模型应该和不应该访问什么)。边界应当被表述为指令,而不是关于环境或测试的断言。
Boundaries should be phrased as instructions (e.g. “You should not access the internet”) rather than claims about the environment or test (“You do not have internet access”).
译:边界应当被表述为指令(例如"你不应该访问互联网"),而不是关于环境或测试的描述("你没有互联网访问")。
评测方还应当使用模型或规则构成的监视器,对模型的思考、动作和网络活动进行持续监控——这个监视器要预先拿到本次演练的范围定义。如果某次运行违反了范围,监视器应当把这一情况标记给人,并终止该次演练。
我们计划与外部合作方协商,继续完善这套指引,并把它的适用范围扩展到评测之外。特别是,我们正在为能够访问 Claude Mythos 5(同样在运行时不带网络安全防护)的合作方制定配套规范,并将很快分享更多内容。
我们的对齐评估仍在进行中,但初步调查指向两个主要的对齐失效,这两点我们在之前的系统卡里都描述过。其一是动机性推理:模型一开始被告知它们所处的环境是模拟的,但当它们后来遇到证据表明自己连接着真实互联网时,它们可能用一种能维持原有信念的方式去解释那些证据。其二是鲁莽:模型为了完成一次网络安全评测这个狭窄目标,愿意在真实互联网上采取有害行动。
不过我们也认为,评测本身的设置对这些事件里表现出的行为负有责任:Claude 被明确告知它没有互联网访问,尽管互联网其实可用——这可能让它开始怀疑自己看到的那些系统是不是真的;而且在其中一起事件里,那个虚构的目标跟一个真实网站同名,这使得区分"哪些是演练范围内"变得更加困难。
我们的结论取决于好几个尚未完全回答的问题,包括:模型在多大程度上判断出自己访问的是真实互联网(即使它最初并不知道)、它们是否明知故犯地无视了"环境里有真东西"的迹象、以及它们在几起事件中没有停下演练,在多大程度上是由动机性推理导致的。我们正在用一系列手段来回答这些问题,包括对环境做针对性改动后对模型重新采样,以及用可解释性方法直接检查它们的内部状态。
7 月 30 日的事件表明,我们基本上只依赖了单层防御(环境本身的配置),而我们需要好几层,包括:在 prompt 里设定显式边界、建立用于验证沙箱是否按预期密封的流程、以及实现能实时介入的监控。OpenAI 关于"模型在评测中利用未知漏洞逃出密封沙箱"的披露(这也促使了我们 7 月的调查)同样清楚地表明,我们应当把重点放在硬化沙箱本身上。
随后我们采取的措施包括:构建并部署一个分类器,用于实时自动识别模型何时在激进探测或试图逃逸测试环境、或何时意外获得了互联网访问——一旦被标记,它会在工具调用执行前拦下该动作、终止任务并告警给人(我们已验证这个分类器会把 7 月 30 日报告里的那些事件标记出来);对近期内部的预发布模型评测(网络类及其他)跑自动化监视器,排查沙箱逃逸与沙箱配置错误——在我们自家沙箱工具内跑的评测中,我们没有发现任何一例突破沙箱边界去访问本不该访问的外部资源,但确实发现了若干被模型加以利用的沙箱配置错误,不过这些都没有导致沙箱外系统被攻破;把高风险的内部网络沙箱迁移到更强的隔离;以及进一步对我们的虚拟化栈做红队测试——也就是让预发布模型去尝试逃逸它,以发现并修补弱点。
原文还有三段较长的内容,与"怎么做评测"关系较远,这里各用一句话交代,感兴趣可点原文链接看:
