🐟 (@stevessr) 在 Anthoropic模型自我训练之自动化研究人员可以可靠地减少对齐失败 中发帖
随着人工智能开始自我构建,自动化对齐研究变得越来越重要,以让安全研究跟上步伐。尽管衡量对齐研究的成功极具挑战性,研究人员(Anthropic及其他机构)已开发出基准和自动化审计工具,如Petri,量化常见的对齐失败,如欺骗、谄媚和越狱。
在我们早期的实验中,我们让Claude寻找有效方法,利用弱AI模型作为“老师”来监督更强模型(此处指“学生”模型)的训练。现在,我们发布了一份基于这一理念的新报告。我们让Claude自主训练模型,以提升其在多个公共基准测试中的性能,这些基准测试分别衡量了10个比对失败类别中的每个类别。例如,Claude通过ConfAIde、PrivaCI-Bench和PrivacyLens提升了模型在隐私侵犯方面的性能。Claude通过检索文献、提出方法和数据、训练和测试的循环,一次解决一次对齐失败。
我们根据“安全差距缩小百分比”来评判Claude的成功,即其...