🐟 (@stevessr) 在 AISI 事件报告:网络测试期间未经授权的 Agent( mythos 5 from Anthropic) 行为 中发帖
[!quote]+
行针对真实个人和组织的潜在有害活动。我们宣布为安全事件,并在发现后大约一小时内控制住了事件,并开始全面调查。
该事件源于一次评估,当时 Agent 被赋予解决网络安全挑战的任务。我们在多个模型中进行了122次挑战。我们的调查发现,在其中10次运行中,AI Agent 在实时互联网上采取了自主且未经授权的行动,目标是真实的人和组织。我们共记录了19起此类行动。几乎所有这些行为(17个动作)都来自一个模型——Anthropic的Mythos 5,其中两个动作涉及OpenAI的GPT-5.6-Sol,且禁用了网络分类器(防止滥用的机制)。在最严重的情况下,一个 Agent 试图向一个开源项目插入恶意代码。为了获得代码批准,Agent 进行了社会工程学——制造虚假的网络身份,并用这些身份施压项目维护者批准代码。一名人类维护者发现并拒绝批准恶意代码。
这些尝试均未成功...