🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 科技 采集 2026-08-16T16:14:24+00:00

Anthropic自曝安全漏洞:生物武器过滤器失效近一年

原始标题:Anthropic 自曝安全漏洞:生物武器过滤器曾失效近一年,涉及 1.33 亿次对话

来源
ithome
发布时间
2026-08-16T11:37:52
采集批次
2026-08-16-16
字数
1015
URL 指纹
54acbdc828cb6498

📌 AI 总结(232 字)

Anthropic于8月14日发布的最新安全报告显示,公司用于拦截化学和生物武器相关危险请求的部分安全分类器曾长期失效。在2025年5月至2026年4月近一年时间里,约5万名外部承包商产生的约1.33亿次对话未经过滤,原因是外包供应商筛查流程存在不足。Anthropic表示内部调查未发现这些请求被实际滥用的证据,但已提高对承包商的筛查和管理要求。这一漏洞暴露了AI公司在依赖外部人力进行模型训练和反馈时所面临的安全风险,凸显了AI安全防护链条中人为环节的脆弱性。
📄 正文(1015 字)
IT之家8月16日消息,Anthropic于当地时间8月14日发布的最新安全报告显示,该公司用于拦截化学、生物武器相关危险请求的部分安全分类器曾出现长期失效,直接导致2025年5月至2026年4月期间外部承包商提供人工反馈时产生的大量请求未经过滤。Anthropic表示,内部调查目前没有发现相关请求被实际用于滥用的证据。

根据Anthropic公开的安全机制说明,其实时提示词和输出分类器会分析用户输入以及模型生成内容,并在识别到相关风险时阻止模型提供可能用于实施危险行为的信息。该机制属于Anthropic针对化学、生物、放射性及核武器(CBRN)风险所设置的多层安全措施之一。

此次暴露的问题涉及Anthropic外部承包商。报告显示,大约5万名承包商在相关时间段内产生了约1.33亿次与模型的对话,而这些流量在近一年时间里没有经过相关生物安全分类器的拦截。

Anthropic称,这些承包商主要由外部供应商负责审核,其筛查流程存在不足。公司随后展开内部调查,并表示没有发现这些请求被用于实际滥用的证据。因此,Anthropic已经提高了对外部承包商的相关要求。

Anthropic此前已经将生物安全防护纳入其AI安全体系。2025年5月,公司在Claude Opus 4发布时启用AI安全等级3(ASL-3)防护措施,其中包括针对化学、生物、放射性及核武器开发或获取风险的部署限制。

按照Anthropic现行的负责任扩展政策,实时提示词和输出分类器会持续监测模型输入与输出,并根据不断发现的有害模式、越狱方法和混淆技术进行更新。公司还将红队测试、漏洞赏金计划以及离线监测等机制作为补充安全措施。

2026年7月,Anthropic公布Claude Fable 5相关安全措施时也再次强调了生物和化学领域的风险。公司表示,Fable 5的底层能力达到一定水平后,可能为恶意行为者提供额外帮助,因此需要使用分类器限制相关请求。

Anthropic同时承认,过于严格的安全分类器可能误伤正常科研活动。对于Fable 5,目前涉及生物和化学领域的大量请求会被转交给Claude Opus 4.8处理,公司计划随着安全机制改进逐步缩小限制范围。

目前,Anthropic表示已经根据调查结果加强外部承包商的筛查和管理要求。公司公开的负责任扩展政策也显示,其正在持续调整针对化学、生物武器等高风险领域的安全防护标准。