奥斯卡 (@wuyoscar)AI 安全日报 中发帖

佬友们好 我对自己的定位就是 AI 安全的学习者 科普者 
所以不定时 每天分享一下我看到的东西 
 [Snipaste_2026-08-15_11-11-40] 


JailbrokenAI/wallbreaker 让Agent 全自动调用攻击技巧去测试其他模型。把五花八门可以用来装饰 prompt 的攻击做成脚本或工具让 Agent 调用或排列组合 (这一点从源代码~/tools/*, 看得非常清楚)。里面有大量的文本变形攻击,Jailbroken 论文(wei et al)定义这类攻击为 “string-transformation”。我用的“装饰”定义来自论文h3rm4l,那篇 做了类似探索。还有就是 AutoJailbreak(另外一个用 agent 驱动攻击的开源项目) 也做过这个事情。这类红队架构成功的本质:1)整理好了质量高的攻击算子, 2)自动化 agent 不拒绝这个...
 
 
Back to Top