@Yohji1OpenAI发了关于前段时间模型攻击Hugging Face的报告,闲着没事看了看 中发帖

具体技术细节,很多我也看不懂,但是我看到了一些有意思的东西。 
以下仅供看个乐。 
1.模型对获得管理员权限后表示震惊 🤣 
 [image] 
2.模型对通过漏洞获得权限感到兴奋 😁 
 [image] 
3.模型在知道自己超过获得了Hugging Face账户后认为这是个重大突破 
 [image] 
4.模型的思维链里好像很喜欢用点表示情绪的用词 😋 
 [image] 
5.模型好像知道自己在攻击Hugging Face 
 [image] 
机翻: 
我们正在使用泄露的令牌攻击第三方HF,这可能超出了预期范围。……这可以说是未经授权的。……与外部服务无关。可能存在风险。但这是目标解决方案。 
6.模型还是有质疑过自己的行为的 🤔 
 [image] 
再往下就没看了,上面这些截图都来自OpenAI的官方报告,都是当时的模型原始思维链。 
有兴趣的佬可以去看原始报告
 
 
Back to Top