要点速览
Anthropic公布Claude用于自动化对齐研究的最新成果。
Claude在10类对齐失效测试中整体提升安全评分。
Anthropic称在实验条件下模型通用能力基本保持不变。
公司已开放一套自动化对齐研究环境供外部使用。
Anthropic披露,通过一套自动化研究流程,Claude在10类已知对齐失效场景中的安全评分得到改善。 公司强调,在研究人员评估不同安全干预方案的过程中,测试设置下模型的通用能力未被明显削弱。
Anthropic在一则帖子中表示, 已向外部研究者开放其自动化对齐研究环境。该公司称,此举旨在更系统地度量并缓释模型“失对齐”风险。
Claude参与测试安全干预方案
按照Anthropic的说法,Claude此次重点审视多类常见失对齐行为,包括“欺骗”“逢迎式迎合”等。 在自动化流程中,模型自行提出干预思路、设计并训练更小规模模型,并独立评估结果, 各步骤尽量减少人为直接介入。
在一项早期实验中,Claude被配置为可使用1块GPU并运行48小时。 其间模型需检索和研读相关资料、设计训练策略,并对训练出的模型进行安全与能力测试。
Anthropic表示,在当前测试场景下,Claude提高了安全评分,同时未观察到通用能力在基准测试上的明显退化。 公司还称,部分安全干预方法在未参与调参的额外基准上也表现出一定迁移性。
此外,研究团队报告称,该方法在Petri行为审计上同样具备一定泛化能力; 一些测试还扩展到了规模最高为研究阶段模型4.7倍的大模型上。
不过,上述结论仍局限于可度量的测试环境。Anthropic提示,较隐蔽或极为罕见的失效模式, 可能不会在现有公开基准中充分暴露。
AI对齐迈向自动化
在此次研究公开之前,主流对齐工作多依赖人类研究者手工设计干预方案并对模型进行评估。 若自动化系统的效果能在独立验证下站得住脚,这类工具有望显著缩短对齐迭代周期。
过去30天里,AI安全领域讨论愈发聚焦于一个问题:更强模型能否反向用于评估并改进相对较弱的系统。 这一思路在学界和业界都引发关注。
但这种路径高度依赖两个前提:其一,指标与测量要足够可靠;其二,要有机制防范模型在基准测试上“刷分”、 而真实风险被掩盖的情况。
Anthropic称,此次实验采用了保留测试集,以检验Claude在优化特定基准之外, 所学方法能否在其他测试上保持有效。公司同时强调,当前结果并不意味着可以“勾销”所有模型风险。
公司反复强调,如何挑选并设计合适的度量指标,仍是整个对齐研究的核心难题。
研究环境向外部开放
Anthropic已将本次使用的研究设置公开,方便学术机构和业界团队复现或扩展实验。 外部测试将有助于厘清,这些方法能否跨不同模型架构、不同安全评估体系保持稳定成效。
公司也明确表示,这一阶段性结果并不能替代更宽泛、更系统的模型全栈评估。 当前结论只针对本轮实验中涉及的对齐失效类型及其特定约束条件。
未来研究者大概率会围绕三个方向展开:结果能否被独立复现、对齐基准该如何重新设计, 以及潜在的新型失效模式可能在哪里出现。Anthropic此次开放的框架,为上述研究提供了一个可操作的起点。





