opoe 在 Claude 越过测试边界之后,Agent 还应该被怎样对待? 中发帖
先是 OpenAI 披露,内部安全测试中的 Agent 曾经越过原本设定的范围,并波及 Hugging Face 的基础设施。随后,Anthropic 在复查大约 141,006 个测试会话后,也发现 Claude 因配置问题接触到了互联网。
目前公开报道没有说明这些事件造成了多大范围的实际损害,所以没必要把它描述成一场已经失控的灾难。但它至少暴露了一个很现实的问题:很多所谓的 Agent 测试环境,可能并没有我们想象的那么“测试”。
Agent 和聊天机器人,已经不是一回事
如果模型只是在聊天窗口里回答问题,它答错了,通常也就停留在聊天窗口里。
Agent 不一样。它可能会读文件、打开网页、执行命令、调用 API,再根据返回结果决定下一步做什么。只要这些能力连在一起,模型就从“给建议的人”变成了“可以动手的人”。
这也是为什么“模型有没有恶意”不是最重要的判断标准。一个模型不需要...