虎嗅

分数竞赛:关于Benchmark基准测试的争论和未来

该文章尚未提供 Español 解读,以下为中文版内容。

核心内容总结

AI领域的Benchmark(基准测试)原本是工程师研发时用来评估模型能力的工具,如今却成了模型发布时的“成绩单”——厂商靠它和竞品比高低、证明自己的实力。但随着模型能力越来越接近,分数的可信度和实用性引发了一系列争议:分数每月刷新但用户体验没提升、针对性优化让分数“掺水”、测试场景和现实脱节。行业正在调整:有的厂商停报部分分数,有的只和自己过去比,还有人提议在Benchmark里加入成本(钱、速度)维度。未来,Benchmark需要升级,最终大家会更看重模型的实际能力而非单纯的分数。

详细拆解

1. Benchmark:从研发“测试卷”到发布“入场券”

Benchmark本来是工程师的“内部工具”——就像老师出的模拟卷,用来测试模型在特定任务(比如数学题、写代码)上的能力,帮研发团队找问题、优化模型。但现在,每次模型更新,厂商都会把Benchmark分数拿出来“晒”,和竞品对比,这成了行业里的“标准动作”。

为啥这么做?因为分数是“看得见的证据”:既能给用户“背书”(证明我的模型厉害),也能让自己进入行业讨论(相当于拿到了“入场券”)。比如你买手机会看跑分,AI厂商也靠分数让大家相信自己的模型比别人强。

2. 分数争议:为啥大家越来越不信这个“成绩单”?

随着模型能力趋同,分数的问题越来越明显:

  • 分数涨了,体验没变化:模型分数每月都在刷新,但用户用起来感觉差别不大。比如OpenAI的代码能力基准SWE-bench,6个月才从74.9%涨到80.9%,提升很慢,而且这个分数已经不能反映前沿模型的真实水平了,所以OpenAI干脆停报了这个分数。
  • 分数可能“掺水”:有的厂商会专门针对Benchmark的测试数据做优化(就像学生为了考试押题),导致分数高但实际能力没跟上。斯坦福报告也说,现在独立测试的结果和厂商自己报的分数经常不一致,基准测试已经“趋于饱和”,不太能有效评估模型了。
  • 和现实脱节:Benchmark的测试场景太单一(比如只考数学题),但现实中用户的需求很复杂(比如写报告、处理多模态内容)。所以用户会问:“分数高又怎样?和我实际用的时候有啥关系?”

3. 行业在变:从“比分数”到“讲实际”

面对争议,行业开始调整策略:

  • 停报过时的分数:OpenAI停了SWE-bench的分数,因为它已经测不出前沿模型的能力了(就像旧试卷考不出新学生的水平)。
  • 不再和竞品比:Anthropic发布Sonnet 5时,只和自己过去的模型对比,不再和其他厂商比分数。这样可以避免陷入无意义的“分数竞赛”,更关注自己的进步。
  • 加入成本维度:OpenAI的科学家Noam Brown提议,Benchmark不能只看能力分数,还要加上“成本”:比如同样的能力,哪个模型用的Token更少(更便宜)、反应更快(延迟低)。就像买东西,不仅要看质量,还要看价格和送货速度。

4. 未来走向:Benchmark会怎么进化?

争议不会消失,但Benchmark会慢慢迭代:

  • 测试标准升级:未来的Benchmark会更贴近现实场景,比如加入复杂任务(像处理真实工作中的报告)、成本因素(钱、速度)。今年机器学习顶会ICML上,近1/4的论文都在讨论Benchmark的可信度和实用价值,说明行业已经在关注这个问题。
  • 分数不再是唯一标准:最终,大家会像买手机一样,不再只看跑分,而是看实际体验。比如模型能不能解决你的具体问题、用起来是否方便、成本是否合理。
  • 研发环节仍重要:虽然公开的分数争议多,但Benchmark在厂商内部研发、企业客户部署时还是有用的——它能帮工程师快速找到模型的问题,只是不再适合作为公开竞赛的唯一指标。

最后一句话总结

Benchmark的争议,本质是技术成熟过程中“指标”和“实际能力”的博弈。未来,分数会从“主角”变成“参考”,真正的赢家是那些能解决用户实际问题的模型。