在Claude Code早期,用户面临两难困境:要么对每一步操作手动审批(极为繁琐),要么完全放开权限(风险极高)。

今年早些时候,Anthropic推出了自动模式,通过一个独立的分类器模型,让Claude自主判断哪些操作存在风险、需要人工介入。

从8月14日起,自动模式将成为Pro、Max和Team用户的默认设置(企业用户及Claude API和云平台用户暂时仍需手动开启,计划在未来一个月内完成默认推送)。原因很简单:研究表明,人类在频繁的权限审批中表现并不理想。

Anthropic自身的研究数据显示,用户目前对97%的权限提示选择了批准。

Anthropic指出:"尽管大多数提示可能对应安全的常规命令,但如此高的批准率表明,许多用户是在不加审查地机械点击,而非认真评估每条命令。"

在超过1000名测试人员参与的测试中,研究团队发现:人类仅识别出13.6%的危险命令,而处于自动模式的Claude Code识别率高达89%。

随着测试时长增加,人类测试者的表现持续下滑。在经历50次提示后,测试者仅能发现5%的危险命令。

Anthropic认为,减少权限提示的频率,反而能让用户在真正出现提示时更认真地阅读和评估。

在实际运行中,当分类器标记某条命令时,自动模式会直接拦截,而非请求用户批准。随后,Claude通常会寻找更安全的替代方案,或将该操作提交给用户明确审批。

系统还设有兜底机制:若连续拦截3次,或单次会话内累计拦截20次,自动模式将把控制权交还用户,切换回手动审批。

Anthropic还指出,随着智能体任务时长不断延伸,自动模式大幅降低了用户在执行多小时任务时持续"盯屏守候"的负担。

在此次发布前,Anthropic还对自动模式进行了全面加固。

其中最关键的改进是"硬性拒绝"机制。Anthropic表示,分类器被设计为永不批准数据外泄行为,例如将代码或密钥发送至外部目标。若开发者需要执行此类操作,必须手动退出自动模式或亲自运行命令。

企业还可以自定义"硬性拒绝"规则,针对特定操作设置永久禁止,即便用户主动发起请求也不例外。

分类器现已内置明确规则,规范密钥和机密数据的访问与共享方式,并在执行git push或pull request前检查目标仓库是公开、私有还是受信任的——毕竟,同一次推送操作,根据目标不同,可能是常规操作,也可能构成数据外泄。

此外,分类器在执行git reset --hard等破坏性命令前,会先读取仓库的git状态,确保自动模式了解即将丢弃哪些未提交的工作。同时,API端还新增了一个探针,用于扫描Claude从网页、文件和工具输出中获取的内容,检测提示注入攻击,并在发现异常时向Claude的上下文添加警告。

为验证上述加固效果,Anthropic与Apollo Research开展了为期两周的红队测试,将合成攻击注入真实工作流程。加固前,分类器遗漏了12%的攻击;加固后,在留存测试集上,这一比例降至7%。

Anthropic此次也借机与最大竞争对手OpenAI进行了对比。当然,若结果不理想,Anthropic不会主动公布。Anthropic委托第三方机构测试了自动模式在防御提示注入攻击方面的表现。

Trajectory Labs的测试结果显示:在Anthropic模型的自动模式下,720次攻击尝试无一成功突破(即便在权限完全绕过的情况下,Claude Sonnet、Fable和Opus 5也仅放行了0.09%的攻击)。

相比之下,OpenAI的GPT-5.6 Sol在Codex的完全访问模式下放行了19%的攻击,在自动审查模式下也有近6%的攻击得以通过。

不过,Anthropic自身也坦承,自动模式是一个分类器,而非万无一失的保障——它能降低风险,但无法彻底消除风险。对于生产基础设施的高风险变更,Anthropic仍建议保留人工审核环节。

除权限机制更新外,Anthropic还于同日宣布:并行运行的多个Claude Code会话现在可以相互通信。这对于多个会话协同处理相关问题、需要同步代码变更的场景尤为实用。

Anthropic在X平台解释道:"现在无需在另一个会话中重新说明情况,只需告知Claude去同步即可。它会发送一份摘要(不包含历史记录或文件),另一个会话便能在任务进行中接收并继续。"

Q&A

Q1:Claude Code自动模式是如何判断哪些操作需要拦截的?

A:自动模式使用一个独立的分类器模型来评估每条命令的风险。当分类器判定某操作存在危险时,会直接拦截而非请求用户批准,随后Claude会寻找更安全的替代方案或提交用户明确审批。分类器内置了针对数据外泄、密钥访问、破坏性git命令等场景的明确规则,并可由企业自定义额外的硬性拒绝规则。

Q2:自动模式的安全性和OpenAI相比怎么样?

A:根据第三方机构Trajectory Labs的测试,在Anthropic模型的自动模式下,720次提示注入攻击无一成功突破;即便权限完全绕过,攻击通过率也仅为0.09%。相比之下,OpenAI的GPT-5.6 Sol在完全访问模式下放行了19%的攻击,自动审查模式下也有近6%通过。不过Anthropic也强调,自动模式只能降低风险,无法完全消除风险。

Q3:自动模式对哪些用户是默认开启的?企业用户怎么办?

A:从8月14日起,自动模式将成为Pro、Max和Team用户的默认设置。企业用户以及通过Claude API和云平台使用的用户暂时仍需手动开启,Anthropic计划在未来一个月内完成这部分用户的默认推送。

The New Stack