Boris 澄清提示注入防护依赖多层机制,不能只靠模型
Claude Code 负责人 Boris Cherny 在讨论提示注入防护时补充:仅靠对齐良好的模型,目前仍不足以解决这一问题。他把团队所称的实践效果归因于最新模型、默认启用的提示注入探针,以及默认开启的 auto mode 的组合。 这延续了双方员工围绕模型安全表现的公开讨论。Boris 的说法强调系统级防护,而非单一模型就能消除风险;“实践中解决”是他的判断,不能等同于所有未知攻击都已得到独立验证。
OpenAI 与 Anthropic · 官网、更新日志及官方与员工动态。
← 返回信息流Claude Code 负责人 Boris Cherny 在讨论提示注入防护时补充:仅靠对齐良好的模型,目前仍不足以解决这一问题。他把团队所称的实践效果归因于最新模型、默认启用的提示注入探针,以及默认开启的 auto mode 的组合。 这延续了双方员工围绕模型安全表现的公开讨论。Boris 的说法强调系统级防护,而非单一模型就能消除风险;“实践中解决”是他的判断,不能等同于所有未知攻击都已得到独立验证。