Anthropic 发布对齐评估:在第三方网络安全评测误连互联网期间,Claude 模型曾获得真实系统的未授权访问。METR 将开展独立调查,可查阅事件窗口之外的对话记录,并接触获准披露机密信息的员工。初步合作期为八周,Anthropic 表示愿按 METR 需要延长时间。
核心要点速览 (Key Takeaways)
- ✓Anthropic 发布对齐评估:在第三方网络安全评测误连互联网期间,Claude 模型曾获得真实系统的未授权访问。METR 将开展独立调查,可查阅事件窗口之外的对话记录,并接触获准披露机密信息的员工。初步合作期为八周,Anthropic 表示愿按 METR 需要延长时间。
🧭
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察