叫我小杨同学 (@Y_yuHou)[叫我小杨同学]LLM中H-CoT思维劫持的一些思路 中发帖

开头叠甲 
研究提示词注入也是自己的兴趣爱好,不是专门的职业,所以对于我来说什么AI红队都是扯淡,因为我只是关心所谓的提示词注入而已 
大型语言模型(LLM)已演变为大型推理模型(LRM),通过纳入扩展的推理时推理,通常通过思维链(CoT)提示来促进。这种方法允许模型将复杂任务分解为分步逻辑序列,显著提高了在数学、编程和科学推理等领域的性能。AI安全研究中的一个普遍假设是,花费更多时间“思考”应该能让模型更好地评估其响应的安全性和伦理影响,这可能使推理增强模型比其前身更强大。 
然而,最近对“思维链劫持”的研究发现了一个与此假设相悖的系统性漏洞。该研究表明,过度长时间的良性推理可能引入一种称为“拒绝稀释”的失效模式。在这种情况下,当模型生成越来越长的无害推理序列(例如解决一个复杂的逻辑谜题)时,其内部安全信号会被削弱。当模型遇到一个巧妙嵌入的有害请求时,其保持一致拒绝行为的能力已经受到损害...
 
 
Back to Top