AI OBSERVER ← AFreeCoder

AI 信息流

OpenAI 与 Anthropic · 官网、更新日志及官方与员工动态。

← 返回信息流
2026-09-12

Claude Code 新增插件评测,可对比启用与不启用插件的实际效果

Claude Code · 开发者工具与 API

Claude Code 新增 claude plugin eval,用测试用例评估插件或 Skill 带来的效果。开发者可用 claude plugin eval init 描述好坏结果、提供真实提示词,让 Claude 草拟用例与评分检查;运行后可比较同一任务启用和不启用插件时的分数,并查看 JSON 与 HTML 报告。 官方文档要求2.1.269或更新版本,默认每个用例在两种条件下各运行三次。评测及模型评分会消耗账户用量,结果也会波动;官方建议先用 --runs 1 试跑,只评测可信插件。支持的账户还可把报告发布为私有产物,便于查看逐次结果。