Anthropic Fellows 研究显示,Claude 可在 48 小时、单 GPU 约束下自主调研、提出方法并训练评测小模型,针对欺骗、谄媚等 10 类可测对齐缺陷爬山优化,同时不损伤通用能力。最佳方法可泛化到未优化基准、Petri 行为审计,以及最多大 4.7 倍的模型。首次后继对齐测试中,Sonnet 5 对早期 Opus 4.8 检查点做后训练,安全分数接近完整对齐训练的生产版。Anthropic 同时开源自动化对齐研究设置,并强调稀有失败仍取决于能否度量正确目标。

核心要点速览 (Key Takeaways)

  • ✓Claude 在 10 类对齐失败上提升安全分且不伤通用能力,方法可泛化到 4.7 倍更大的模型。
  • ✓Sonnet 5 将早期 Opus 4.8 检查点拉到接近生产对齐水平,是弱模型对齐强后继的早期证据。
  • ✓自动化对齐研究框架已对外发布;不可测失败仍取决于能否定义正确度量。
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算