03:13Thariq 认为评估模型不能只看通过率,应检查失败案例与隐藏测试Claude Code · 观点与实践Claude Code 团队成员 Thariq 发帖表示,如今只看通过或失败的分数,已经很难解释模型评测。他观察到,基准测试中的不少失败来自过于严格的隐藏测试;有些情况下,模型的回答反而比预设结果更合理。 这条观点强调逐个查看失败案例、评判标准和模型实际输出,而不是仅凭汇总分数下结论。原帖没有点名具体基准,也未给出这类失败所占比例。5 个出处@benhylak@seconds_0@trq212@trq212@trq212