OpenAI 跟进 Dario 的 AI 减速倡议,承诺向独立评估者开放类似员工的权限
Anthropic CEO Dario Amodei 发表《We Must Pace the Frontier》,认为递归自我改进正在加快 AI 能力增长,近期智能体失控事件也表明安全工作需要更多时间。他主张放缓前沿能力提升节奏,为对齐、可解释性与安全评估争取时间,而非全面停止模型训练。 方案分三步:第三方评估者常驻实验室,持续核查安全承诺、事故和训练过程;民主国家的前沿企业在政府支持下协调安全标准及发展节奏;再探索全球协调并验证履约。 Anthropic 宣布率先承诺第一步,拟近期让外部团队获得工位、设备及接近内部风险团队的系统权限。评估者可自主发布关键结论;公司只能因安全、法律或保密理由有限删节,不能仅因结论不利而删改。 更新(9 月 13 日 00:30,UTC+8):Sam Altman 表示赞同 Dario 的主张,这也是 OpenAI 近几周重点讨论的问题。OpenAI 同样承诺给予独立评估者类似员工的访问权限,更多细节将随后公布。 9 月 13 日 00:41,Anthropic 的 Alex Albert 进一步说明:银行和美国核电站已有常驻检查人员,他认为前沿 AI 实验室也应采用类似机制,这是务实的第一步。