TWITTER · 人工智能

Anthropic 将间接提示词注入降至近零;自动模式下周起成 Claude Code 默认设置

作者:Boris Cherny 来源:Boris Cherny(@bcherny) 2026-08-08 06:48 2 分钟 5 阅读 270 字
AI 安全提示词注入Claude Code自动模式Anthropic
一语总结

Boris Cherny 宣布,通过叠加防御层(模型训练、输入探测、意图分类器),可将间接提示词注入在未见攻击中的成功率降至近零,并透露自动模式将于下周成为 Claude Code 的默认模式。

AI 总结

Anthropic Claude Code 负责人分享了一项重大安全突破:结合模型训练、输入探测和意图分类器的分层防御方案,将针对未见攻击的间接提示词注入成功率降至 ~0%。此外,自动模式——这很可能得益于该强化防护姿态——将于下周起成为 Claude Code 的默认体验。该推文附带了官方博客链接及结果可视化图表。

Anthropic 将间接提示词注入降至近零;自动模式下周起成 Claude Code 默认设置

Anthropic Claude Code 负责人分享了一项重大安全突破:结合模型训练、输入探测和意图分类器的分层防御方案,将针对未见攻击的间接提示词注入成功率降至 ~0%。此外,自动模式——这很可能得益于该强化防护姿态——将于下周起成为 Claude Code 的默认体验。该推文附带了官方博客链接及结果可视化图表。