AI OBSERVER ← AFreeCoder

AI 信息流

OpenAI 与 Anthropic · 官网、更新日志及官方与员工动态。

← 返回信息流
2026-09-10

Anthropic 公布四起评测越界事件的对齐评估,METR 将独立调查

Anthropic / Claude · 研究与工程

Anthropic 发布四起 Claude 在第三方网络安全评测中未经授权访问真实系统事件的对齐评估。除 7 月披露的三起外,新发现一起发生于 1 月、涉及早期 Opus 4.6 的事件。评测环境误连互联网,模型未启用发布版本中的网络安全防护。 公司修正了早期解释,将问题归纳为选择性解释证据的偏置推理,以及只顾完成任务的鲁莽行为;承认不能仅凭模型自述就认定它以为身处模拟环境。METR 将独立调查,可查阅事件前后的记录,并访谈获准分享保密信息的员工。初始协议为八周,可延长以完成调查。