Anthropic称Claude在自动化测试中显著减少对齐失效

Pro and Max users can now pass larger jobs to a single Claude chat after Anthropic merged Cowork and added Docs and Slides (Image: Shutterstock)
Pro and Max users can now pass larger jobs to a single Claude chat after Anthropic merged Cowork and added Docs and Slides (Image: Shutterstock)

要点速览

Anthropic公布最新研究,使用Claude开展自动化对齐实验。 Claude在10项对齐失效测试中全面提升安全评分。 Anthropic称测试过程未削弱模型的通用能力。 公司已开放自动化对齐研究框架供外部研究使用。

Anthropic表示,在一套自动化研究流程下,Claude针对10类典型对齐失效场景的安全评分均有所提升。公司指出,在评估安全干预措施的过程中,被测模型的通用能力基本保持不变。

Anthropic在一篇帖文中称,已向外部研究者开放其自动化对齐研究框架。公司将这项工作定位为“度量并缓解模型失对齐”的一次探索。

Claude参与安全干预测试

按照Anthropic的说法,本轮实验聚焦多种常见失对齐形式,包括“欺骗”“迎合式逢迎”等。Claude在几乎无人工干预的条件下,完成了方法设计、训练小模型以及效果评估的全流程。

在一次早期实验中,Claude被分配到48小时时间和一块GPU算力。它利用这一资源调研对齐方案、设计训练方法,并对产出的模型进行测试。

Anthropic称,在相关实验环境中,Claude能够在不明显牺牲通用能力的前提下,显著提升安全指标;部分方法还能迁移到未参与优化的基准测试上,表现出一定泛化能力。

公司披露,其方法在Petri行为审计等项目中同样适用。测试还覆盖了规模最高达研究用模型4.7倍的更大模型。

不过,这些结果均基于有限、可测的测试环境。Anthropic强调,一些隐蔽或极其罕见的失效形态,未必会在现有基准中显现。

延伸阅读波场TRON升级引入P-256验证与更长区块历史

AI对齐开始走向自动化

在本次研究发布前,AI对齐工作总体仍依赖人类研究者手工设计干预方案并逐一评估模型表现。如果自动化系统的结果能在独立验证中站得住脚,这一流程有望被大幅提速。

过去30天里,AI安全讨论中一个升温话题是:更强的模型是否可以用来评估并改进较弱系统。这一路径高度依赖可置信的指标体系,以及防止“刷榜式”虚高成绩的安全机制。

Anthropic表示,其实验专门使用“留出测试集”检验方法是否能泛化到Claude未直接优化过的基准上。同时,公司明确并未声称基准成绩可以“兜底”所有模型风险。

公司一再强调,如何挑选合适的测量指标,仍然是这项工作的核心难点之一。

对外开放研究框架

Anthropic此次将整套研究框架公开,方便其他团队复现实验或在此基础上继续拓展。外部测试将检验这些方法能否在不同模型和不同安全评估体系中同样奏效。

公司同时强调,这些发现不能替代更广泛、更系统的模型评估。目前的结论仅限于所测试的那几类对齐失效及相应实验条件。

预期来看,后续研究焦点将围绕结果复现性、基准设计质量以及潜在失效模式展开。Anthropic的公开框架为这类研究提供了一个可操作的基础结构。

下篇看这个Fomo式跟单交易让近94%钱包亏损:研究

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza 是一位经验丰富的财经记者,在报道加密货币和区块链技术方面具有丰富经验。他曾为 Benzinga 和 Cointelegraph 等多家媒体撰稿,报道新兴趋势、监管环境等内容。你可以在 Twitter 上通过 @murtuza_merc 和在 Telegram 上通过 mmerchant001 找到他。 披露:Murtuza 持有 ATOM、AKT、TIA、INJ 和 OSMO。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
Anthropic称Claude在自动化测试中显著减少对齐失效 | Yellow