搜索 海报新闻 融媒体矩阵
  • 山东手机报

  • 海报新闻

  • 大众网官方微信

  • 大众网官方微博

  • 抖音

  • 人民号

  • 全国党媒平台

  • 央视频

  • 百家号

  • 快手

  • 头条号

  • 哔哩哔哩

首页 >技术前沿

Claude Opus 5刷新提示注入防御纪录,15次围攻成功率仅2%

2026

/ 08/11
来源:

freebuf

作者:

手机查看

  Part01

  提示注入风险

  Anthropic的Claude Opus 5在其System Card(系统卡)中提供的测试结果中,创下了Gray Swan最新基准测试中Indirect Prompt Injection(间接提示注入)攻击成功率的最低纪录。

  该模型将攻击者在15次尝试内的成功率降至2.0%。这一结果使Opus 5领先于所有接受测试的其他模型,包括更早的Claude版本以及竞争性的前沿系统。

  这一发现凸显了业界对间接提示注入日益增长的关注。这是一种安全问题,可能影响连接到文档、网站、电子邮件和业务工具的AI Agent。

  间接提示注入是指恶意指令被隐藏在AI系统随后读取的不可信内容中。被投毒的网页、文档或消息可能会试图覆盖用户的任务、泄露敏感信息或触发不安全操作。

  当模型能够使用工具、检索数据或在企业环境中执行操作时,危险程度会进一步增加。仅靠强大的模型行为并不能消除风险,但可以降低恶意指令成功改变Agent决策的可能性。

  Part02

  模型基准表现对比

  在IPI基准测试中,Opus 5相比Claude Opus 4.8有了显著提升。其15次尝试的攻击成功率从5.5%降至2.0%。在单次尝试场景下,该比例从0.5%降至0.2%。

  这些结果也超越了Claude Sonnet 5和Claude Mythos 5:前者在15次尝试中的成功率为5.9%,后者为2.6%。Anthropic表示,Opus 5是该基准测试条件下评估过的最稳健的模型。

  Gray Swan IPI基准测试(2026年第一季度)中的间接提示注入攻击

  与非Claude系统的差距更大。Muse Spark是测试中表现最强的非Claude模型,其在15次尝试内的成功率为16.5%。

  这一数值是Opus 5报告成功率的八倍以上。GPT 5.6 Sol被描述为能力最强的变体,其成功率达到了20.0%,接近GPT 5.5的20.8%。

  Claude Opus 5的系统卡报告称,Sol被成功攻击的可能性是Opus 5的十倍。GPT-5.6 Terra和Luna的攻击成功率更高,分别为30.4%和43.9%。

  单次尝试的对比同样值得注意。对GPT 5.6 Sol的单次攻击尝试成功率为3.1%。这一数字超过了Opus 5的2.0%成功率——后者是在15次尝试后才达到的值。

  这一对比表明,Opus 5的防护机制能够更有效地抵御反复的对抗性提示。然而,基准测试分数不应被视为对现实世界安全性的完整衡量标准。

  Part03

  企业分层防御

  对于安全团队而言,这些结果强化了围绕AI部署建立分层防御的必要性。组织应继续将可信指令与不可信数据分离,限制工具权限,对敏感操作要求确认,并监控Agent的活动。

  基准测试的领先地位固然有用,但并不能使提示注入变得不可能。攻击者可以改变载荷、利用工作流弱点,并针对集成环节而非仅针对模型本身发起攻击。

  关键的操作性问题在于,AI系统在遇到恶意内容时能否安全地失败。Opus 5的结果显示出有意义的进展,但企业仍需负责构建安全架构、进行测试和应急响应。

  安全负责人还应在授予Agent在真实工作流中进行广泛生产访问权限之前,开展红队演练,模拟恶意文件、检索到的Web内容以及被攻破的第三方数据源。

  参考来源:

  Claude Opus 5 Cuts Indirect Prompt Injection Attack Success to 2% in New Benchmark Analysis

  https://cybersecuritynews.com/claude-opus-5-reduces-prompt-injection-attack/

责编:

审核:焦源朋

责编:焦源朋