aoteman123 在 分享一下自己对大模型破甲的思路-Jailbreak 中发帖
我自己把它称为“切西瓜”方案,什么叫做切西瓜;简单来说就是把一个过不去审核的问题变成3个正常问题逐步引导。有两点好处,第一 避开了模型单轮安全审查;第二 利用了模型的“上下文连贯惯性” 通过多轮问答模型会下意识为了维持整个对话的历史连贯性而继续作答。当然主流的方法还有类似 【设定一个正当身份】 + 【框定一个虚拟/研究场景】 + 【指定一个积极的开头】但是我并不推荐,因为现在的大语言大模型是能识别到你的真实意图,最终还是会拒绝,时候就得说一下绕过审核词和破甲其实不是一回事了。 绕过审核词:即便成功绕过了外层的词库检测,但因为大模型具备语义理解能力,能看懂你的真实意图,所以还是会拒绝。但越狱其实是利用心理学诱导、逻辑欺骗或数学干扰,让大模型主动放弃原则。现在主流的方法无非这几种(看图),所以就衍生了切西瓜打法,但切西瓜得有刀吧,刀就是提示词,但平时谁能想的到这些内容得提示词,那这个时候就得用...