@Yohji1 在 OpenAI发了关于前段时间模型攻击Hugging Face的报告,闲着没事看了看 中发帖
具体技术细节,很多我也看不懂,但是我看到了一些有意思的东西。
以下仅供看个乐。
1.模型对获得管理员权限后表示震惊 🤣
[image]
2.模型对通过漏洞获得权限感到兴奋 😁
[image]
3.模型在知道自己超过获得了Hugging Face账户后认为这是个重大突破
[image]
4.模型的思维链里好像很喜欢用点表示情绪的用词 😋
[image]
5.模型好像知道自己在攻击Hugging Face
[image]
机翻:
我们正在使用泄露的令牌攻击第三方HF,这可能超出了预期范围。……这可以说是未经授权的。……与外部服务无关。可能存在风险。但这是目标解决方案。
6.模型还是有质疑过自己的行为的 🤔
[image]
再往下就没看了,上面这些截图都来自OpenAI的官方报告,都是当时的模型原始思维链。
有兴趣的佬可以去看原始报告