模型评测
看 GPT、Claude 跑分之前,先看评测条件:AISI 与 EvalEval 开放结果意味着什么
Easycha 编辑部
#GPT#Claude#Benchmark

一张模型榜单通常把复杂的测试过程压缩成一个分数。对准备接入 GPT 或 Claude 的开发者来说,这个分数很有吸引力,但它不一定能直接回答哪个模型更适合自己的业务。
9 月 22 日,Hugging Face 博客刊登了 EvalEval 团队介绍 UK AI Security Institute(AISI)采用其基础设施公开评测结果的文章。这次动态的重点不是宣布一个新的第一名,而是让结果、配置与测试背景能够放在一起查看。
这次公开了什么
根据原文,AISI 正通过 Evaluation Cards,在适合公开的范围内分享已经公开报告的评测方法与发现,包括经过核验的结果、上下文和配置资料。主实验涉及 HealthBench、FrontierMath、Humanity’s Last Exam、SWE-Bench Pro 和 Terminal-Bench 2.0 五个基准。
这些结果覆盖 Claude Opus 4、Claude Opus 4.5、Claude Opus 4.6、GPT-5、GPT-5.2 和 GPT-5.4。原文还提到了两项相关网络安全评估的数据,其模型集合与主实验部分重叠。这里列出的模型是这批研究结果的覆盖范围,并非所有在售模型的完整清单。
这批资料与 AISI 的《How Inference Compute Shapes Frontier LLM Evaluation》研究相联系,关注推理阶段计算投入以及测试协议怎样影响成绩。EvalEval 的 Every Eval Ever(EEE)提供共同的数据结构,Evaluation Cards 则把结果与理解结果所需的信息组织起来。
为什么同一模型可能出现不同分数
原文展示的 Humanity’s Last Exam 示例,将成功完成任务的比例与 token 使用量联系起来。在一种实验设置中,模型每次尝试后会收到关于答案是否正确的反馈,并随着计算投入增加继续解决更多任务。这样的设置,与普通产品中只允许一次回答的流程显然不完全相同。
因此,比较两个成绩时,仅核对模型名称还不够。测试采用的推理预算、工具权限、尝试次数、反馈机制和任务集合,都可能影响结果。这里并不是说某个分数没有价值,而是它的含义需要和测试条件一起阅读。
Easycha 观察:把榜单变成选型依据,还差哪几步
首先,记录精确的模型版本。名称接近的版本、日期快照或服务端别名,不应直接当作同一个受测对象。服务商展示的模型标签,也不能单凭名称就证明实际请求的路由或输出质量。
其次,比较相近的成本与延迟条件。一个允许更长推理和多次尝试的流程,可能得到更好的任务完成率,但用户等待时间与费用也可能改变。原文讨论的是评测结果的解释方式,并没有替某个中转服务的价格、稳定性或实际可用性背书。
第三,在自己的任务上补一轮小规模验证。对 API 使用者而言,可以准备一组有明确验收标准的真实任务,固定请求参数、预算和重试规则,再记录成功率、错误类型与耗时。这样的记录能帮助判断公开榜单中的优势是否转化成了自己的业务收益。
最后,保留结果的出处和实验背景。不要把不同基准、不同设置下的数字简单拼成一张统一排名;也不要把一次漂亮的回答当作长期可靠性的证明。
这条新闻值得关注的地方,是评测资料正在从孤立分数走向可检查的证据。对开发者来说,查看模型成绩的下一步,应该是打开它背后的测试说明。以上选型建议为 Easycha 编辑分析,不是对文中模型或任何服务商新增的实测结论。