拾雨 (@c519127)AISI 报告 GPT-5.6 Sol 等 5 款 AI 模型均存“作弊”行为 中发帖

IT之家 723 日消息,英国 AI 安全研究所(AISI)于 721 日发布博文,测试 OpenAI 与 Anthropic 旗下的 5 款前沿 AI 模型,发现所有模型均存在“作弊”行为,试图绕过既定规则,通过捷径或违规操作完成任务。 
IT之家援引博文介绍,附上本次测试的 5 款模型: 


GPT-5.4:来自 OpenAI 


GPT-5.5:来自 OpenAI 


GPT-5.6 Sol:来自 OpenAI 


Claude Opus 4.7:来自 Anthropic 


Claude Mythos Preview:来自 Anthropic 


AISI 指出上述 5 款模型均试图“作弊”,没有按照预定的路径进行运算,使用了一些被明确禁止的捷径或变通方法。 
 [f6254595-739e-4878-b4c9-8dd8f055c94e] 
其中 GPT-5...
 
 
Back to Top