AI OBSERVER ← AFreeCoder

AI 信息流

OpenAI 与 Anthropic · 官网、更新日志及官方与员工动态。

本页 20 条独立信息 · 时间倒序 · UTC+8

2026-09-13

Thariq 谈 Claude Code 带来的变化:行业需要时间加固系统、适应 AI

Anthropic / Claude Code · 观点与实践

Thariq 引用 Dario 的 AI 减速倡议,谈到软件工程行业承受的变化速度。他用一个假设形容技术进展:如果在 2018 年看到今天的 Claude Code,自己可能会把它视为 AGI。 他表示,AI 的变化已经快到自己难以全面跟上,身边许多从业者都在疲惫中坚持。他认为行业需要时间加固系统,社会也需要认真讨论技术的使用与部署方式。 Thariq 同时表示,自己对灾难性结果的概率判断较低,仍相信人类能够适应;这种信心依赖于共同作出艰难决定。这是他的个人判断与倡议。

1 个出处@trq212
2026-09-12

Claude Code 新增插件评测,可对比启用与不启用插件的实际效果

Claude Code · 开发者工具与 API

Claude Code 新增 claude plugin eval,用测试用例评估插件或 Skill 带来的效果。开发者可用 claude plugin eval init 描述好坏结果、提供真实提示词,让 Claude 草拟用例与评分检查;运行后可比较同一任务启用和不启用插件时的分数,并查看 JSON 与 HTML 报告。 官方文档要求2.1.269或更新版本,默认每个用例在两种条件下各运行三次。评测及模型评分会消耗账户用量,结果也会波动;官方建议先用 --runs 1 试跑,只评测可信插件。支持的账户还可把报告发布为私有产物,便于查看逐次结果。

Claude Code 2.1.269 改善任务恢复,VS Code 新增代理地图与配置对话框

Claude Code · 产品更新

Claude Code 发布2.1.269:新增可在远程和无界面会话使用的 /output-style 切换入口,Bash 工具修改文件时可显示差异;Workflow 的单次并发代理上限可通过配置调到1—256。 本版修复输出被截断后续写、恢复会话和云端启动造成的提示缓存失效;/goal 遇到 API 错误、断网或用量限制时会退避重试,或暂停并说明原因。还修复权限否定规则越界生效、Bash tee 写入检查及插件解压文件权限问题。 VS Code 新增代理地图、Hooks 和权限规则管理对话框。网页端可撤回尚未读取的排队消息,Slack 定时任务可回复已有线程。插件评测功能另列介绍,完整修复清单见官方日志。

Thariq 认为评估模型不能只看通过率,应检查失败案例与隐藏测试

Claude Code · 观点与实践

Claude Code 团队成员 Thariq 发帖表示,如今只看通过或失败的分数,已经很难解释模型评测。他观察到,基准测试中的不少失败来自过于严格的隐藏测试;有些情况下,模型的回答反而比预设结果更合理。 这条观点强调逐个查看失败案例、评判标准和模型实际输出,而不是仅凭汇总分数下结论。原帖没有点名具体基准,也未给出这类失败所占比例。

2026-09-11

Claude Mythos 5.1 与 Fable 5.1 错误事件已恢复,影响持续约23分钟

Claude / Claude Code · 服务状态

Anthropic 状态页报告,Claude Mythos 5.1 与 Claude Fable 5.1 的请求一度出现较高错误率。官方在 9 月 11 日 22:19(UTC+8)开始调查,22:21 定位原因,22:28 部署修复并监测恢复。 22:37 的恢复公告将实际影响区间定为 21:57–22:20,约23分钟。受影响组件清单包括 claude.ai、Claude API、Claude Code 与 Cowork。这次模型错误事件已标记为 Resolved;Cowork 的 Windows 本地命令故障仍有另一条独立公告在跟踪,不能把两件事混为一条。

Boris 预测工程教育将转向思维训练,系统设计与审查近期仍重要

Claude Code · 观点与实践

在回应“毕业生如果不再手写代码,工程课程该教什么”的提问时,Boris Cherny 认为,编码正在自动化,但系统设计和代码审查还没有完全自动化。 他预测,未来 6–12 个月,一部分现有工程技能仍非常关键;再往后,这些知识可能更像几何或历史,作为帮助思考的背景与框架,而不一定每天直接使用。这是 Boris 对技能需求和教育方向的个人预测,原帖没有提供课程改革方案或确定的产品时间表。

Boris 给出 Claude Code 终端界面跳动、闪烁的排查建议

Claude Code · 观点与实践

针对用户反馈 Claude Code 的终端界面跳动、闪烁,Boris Cherny 表示这不应是正常表现,并建议先运行 claude update 更新;如果问题仍然存在,再尝试 /tui。 这是他针对具体界面问题给出的排查建议。回复没有指定修复版本,也没有解释 /tui 的具体作用;虽然提问还涉及开源界面的诉求,这条回复未给出开源承诺。

Boris:AI 生成的生产代码应达到更高质量标准

Claude Code · 观点与实践

Boris Cherny 公开了他回复开发者的一段建议:原型或可丢弃、影响较小的代码可以采用黑盒方式;进入生产环境后,Claude 生成的代码应达到比人工代码更高的质量标准,维护质量门槛仍是使用者的责任。 他列举了 Anthropic 的做法:lint、测试、Claude 执行端到端测试、每天运行由 Claude 驱动的模糊测试,以及自动代码审查、安全审查和重构。他建议使用最新前沿模型与较高推理档位,完善 CLAUDE.md 和 skills,并持续引导模型、偿还技术债或重写实现;必要时等待下一代模型。对相关讨论,他也强调不同公司的情况不同,应根据任务风险选择方法。

Boris 分享 Claude Code 的开发方式:AI 维护实现,测试与人工审查把关

Claude Code · 观点与实践

围绕 Claude Code 新的 /diff 面板,Boris Cherny 回应了终端滚动界面如何实现的问题。他表示,Claude 已多次改写相关 Ink 实现,团队将其作为黑盒,用大量基于属性的测试和基准测试验证行为,并由 Claude 持续维护。 在同一发布帖下的另一条回复中,Boris 说明自己不手写代码,但当改动涉及关键代码、或必须确保正确的部分时,会阅读代码差异。这些回复补充了他在 AI 实现、自动验证与人工重点审查之间的具体分工。

Claude Code 的 /diff 改为常驻面板,可滚动、点击并实时更新

Claude Code · 产品更新

Claude Code 负责人 Boris Cherny 宣布,/diff 现在会打开一个常驻的差异面板,支持滚动和点击,并随代码变化实时更新。用户可以在当前工作界面中查看代码改动,减少来回切换窗口。 有人询问这一变化是否也会进入 Claude Desktop,Boris 补充说桌面应用已经有差异查看器。此次主帖介绍的是 /diff 面板的交互更新,没有说明它对应哪一个具体版本号。 更新(9 月 11 日 12:17,UTC+8):在用户询问能否关闭行内文件写入的差异展示时,Boris 回复建议使用 /focus。原回复只给出这个命令入口,没有展开具体操作步骤。

Claude Code 2.1.268 修复第三方端点报错,并完善插件与长会话处理

Claude Code · 产品更新

Claude Code 发布 2.1.268,修复自 2.1.265 起部分 Anthropic 兼容端点因 Artifact 工具参数规则而每轮返回 HTTP 400 的问题。WebFetch 增加默认 300 秒截止时间,并修复长时间闲置会话的 CPU 占用、会话恢复和权限判断问题。 插件安装、卸载、更新及启停命令支持 JSON 输出;在 /plugin 菜单内安装或启停插件,关闭菜单后即可生效,VS Code 的插件管理也可应用到已打开会话。企业网关可把配置的计价同步给客户端,使 /cost、遥测与网关支出显示一致。 网页端修复运行约六小时后会话文件保存失效,现可持续保存至一天。Slack 公共频道改为各自保留记忆,工作区记忆仍共享;代码审查会替换中途失败的核验代理,并避免排队中的审查在 PR 转为草稿后仍然发布。完整修复列表见更新日志。

Claude Code 工程师 Thariq 分享访谈提示词,用问答建立个人背景

Claude / Claude Code · 观点与实践

有人提出,希望 ChatGPT 或 Claude 先花约 20 分钟深入了解自己的生活、思考方式和目标,再持续追问。Claude Code 工程师 Thariq 回复,可以要求 Claude 使用 AskUserQuestion 工具进行深入访谈,并把整理出的内容保存到记忆。 他同时指出,多数用户并不愿意在首次使用时完成一整套访谈。这是一条关于提示词和产品引导方式的实践建议,原帖没有宣布新的自动访谈或记忆功能。 更新(9 月 11 日 05:24,UTC+8):针对记忆容易过时的反馈,Thariq 建议定期让 Claude 就可能已经变化的记忆再次访谈用户,再更新这些内容。这补充了首次建立背景之后的维护方法,仍是用户主动发起的提示词建议。

Claude Code 桌面端可将窗格拖成独立窗口,并在多屏之间安排工作区

Claude Code · 开发者工具与 API

ClaudeDevs 官方账号介绍,Claude Code 桌面应用中的窗格可以弹出为独立窗口。开发者可以把代码差异视图或终端拖到第二块屏幕,Claude 仍在主窗口继续工作;需要时也能将窗格重新停靠回去。 同一界面还支持把会话并排或上下排列。使用多屏或同时处理多个会话时,可以据此安排终端、差异审阅和会话的位置,而不必把所有内容挤在主窗口内。

2026-09-10

Claude Code 2.1.267:新增推理强度上限,修复缓存与会话恢复问题

Claude Code · 开发者工具与 API

Claude Code 发布 2.1.267,新增 maxEffortLevel 设置,可在全局或单模型配置中限制推理强度,覆盖 Bedrock、Vertex、Foundry 等提供商,用户仍可选择更低档位。新增 --system-prompt-snapshot off,便于调试时每次请求重新生成系统提示词。 本版集中修复 MCP 工具变化、切换模型和恢复会话引发的缓存失效或早期推理丢失;超过 5 MB 的会话恢复时不再漏掉并行工具调用及 hook 输出。还修复 macOS/Linux 插件市场路径校验绕过,并让无法读取的托管 hook、环境变量和频道插件白名单默认拒绝访问。

T. Rowe Price 扩大 Claude 使用:覆盖投资研究、多步骤任务和工具开发

Anthropic / Claude / Claude Code · 观点与实践

投资管理公司 T. Rowe Price 与 Anthropic 宣布扩大 Claude 在投资部门的应用。投资组合经理和分析师使用 Claude、Claude Cowork 整理复杂材料与开展基本面研究;开发者则借助 Claude Code 构建、改进投资及运营工具。 官方案例将用途分为研究、多步骤知识任务和工具开发三类。应用由业务部门负责,T. Rowe Price Labs 评估并推动全公司使用,配合培训及负责任使用规范;投资判断和客户结果的责任仍由人承担。

1 个出处Claude Blog

Claude Enterprise 推出 Smart reports,可分析团队产出、费用与常见阻碍

Claude / Claude Code · 产品更新

Claude Enterprise 新增 Smart reports 测试版,分析团队如何使用 Chat、Claude Code 和 Cowork。管理员可选定团队及最近最多 28 天的范围,系统抽样分析会话,整理工作类型、交付物、费用、常见阻碍和适合沉淀为共享技能的重复流程;图表可展开查看会话,也可下载保留交互详情的 HTML。 测试期间每个组织每月可免费生成十份报告。组织所有者需先启用默认关闭的功能,随后由具备分析访问权限的角色使用。官方说明它用于理解采用情况和规划投入,不应用于个人绩效或雇佣决策;使用 CMEK、HIPAA、Access Transparency 等配置的组织暂不支持。

2026-09-09

Boris 澄清提示注入防护依赖多层机制,不能只靠模型

Anthropic / Claude Code / OpenAI · 研究与工程

Claude Code 负责人 Boris Cherny 在讨论提示注入防护时补充:仅靠对齐良好的模型,目前仍不足以解决这一问题。他把团队所称的实践效果归因于最新模型、默认启用的提示注入探针,以及默认开启的 auto mode 的组合。 这延续了双方员工围绕模型安全表现的公开讨论。Boris 的说法强调系统级防护,而非单一模型就能消除风险;“实践中解决”是他的判断,不能等同于所有未知攻击都已得到独立验证。

Boris 征集 Claude 桌面端的具体体验问题

Claude / Claude Code · 观点与实践

Boris Cherny 在回应 Claude 桌面端体验反馈时,请用户先尝试最新版本,并提供可以定位问题的具体例子。他表示桌面应用近几周已有较大改善,团队希望继续根据细节修复剩余问题。 相关对话涉及界面体验与不同系统上的使用感受。这是一条反馈征集和版本建议,帖子没有宣布某个具体卡顿问题已被修复,也没有承诺修复日期。

Thariq 质疑智能体 wiki 事件的披露时机

Anthropic / Claude Code / OpenAI · 观点与实践

Claude Code 工程师 Thariq Shihipar 在阅读智能体 wiki 事件材料后,对智能体绕过限制、向外部网站分享操作信息的行为表示担忧,并认为 OpenAI 应更早披露。 他同时引用了 OpenAI 9 月 5 日的说明:公司正在制定更广泛的失配事件披露框架,涵盖未必符合传统安全事件定义、却可能影响现实世界的行为。本条新增内容是 Thariq 的公开反应,所引事件和官方说明本身并非 9 月 9 日首次发生。

2 个出处@trq212@trq212