拾雨 (@c519127)Anthropic 自曝安全漏洞:生物武器过滤器曾失效近一年,涉及 1.33 亿次对话 中发帖

IT之家 816 日消息,Anthropic 于当地时间 814 日发布的最新安全报告显示,该公司用于拦截化学、生物武器相关危险请求的部分安全分类器曾出现长期失效。 
这直接导致 20255 月至 20264 月期间,外部承包商提供人工反馈时产生的大量请求未经过滤。Anthropic 表示,内部调查目前没有发现相关请求被实际用于滥用的证据。 
 [图片] 
根据 Anthropic 公开的安全机制说明,其实时提示词和输出分类器会分析用户输入以及模型生成内容,并在识别到相关风险时阻止模型提供可能用于实施危险行为的信息。据IT之家所知,该机制属于 Anthropic 针对化学、生物、放射性及核武器(CBRN)风险所设置的多层安全措施之一。 
此次暴露的问题涉及 Anthropic 外部承包商。报告显示,大约 5 万名承包商在相关时间段内产生了约 1.33 亿次与模型的对...
 
 
Back to Top