当基准测试沦为营销工具:AI 评估体系同质化与 AGI 叙事泡沫的批判反思

引言:被数字统治的 AI 时代

每隔几个月,我们就会被一组新数据轰炸:某模型在 MMLU 上拿下 92.5%,某系统在 GPQA 上超越人类博士,某最新旗舰在 SWE-bench 上刷新纪录。这些数字迅速登上科技媒体头条,被市场分析师写进投资报告,最终成为消费者为之买单的理由。

然而,当整个行业陷入对数字排名的执迷时,一个被忽视的事实正在浮现:这些看似客观的评估体系,正成为阻碍我们真正理解 AI 进步的最大障碍。本文试图剥开基准霸权的外壳,直面 AI 能力评估的同质化困境,并对当下愈演愈烈的 AGI 营销泡沫进行必要的批判反思。


一、基准霸权:数字如何绑架了 AI 叙事

1.1 评估体系的"政治化"

过去三年,AI 行业逐渐形成了一套独特的"分数政治学"。一个模型是否被视为"前沿",几乎完全取决于它在几大主流基准上的表现。MPT、GSM8K、HumanEval、MMLU、BBH、ARC-AGI……这些名字构成了一个接近封闭的评估生态。

这种垄断带来了三个直接后果

  • 马太效应加剧:只有跑分领先的模型才能获得关注、算力和资本
  • 研究方向收窄:学术界被迫围绕现有基准优化,而非探索真正新颖的能力维度
  • 评测变成应试:模型开发者深谙"针对基准训练"的技巧,这使得分数与真实能力的脱钩日益严重

1.2 数据污染:基准的自我瓦解

2024 年的一项研究让整个行业震动:分析人员通过简单的统计方法发现,多个被广泛引用的基准测试,其原始数据可能早已出现在主流大模型的预训练语料中。当 GPT-4 在 MMLU 上取得 86.4% 的成绩时,一个无法回避的问题是——它究竟是在"理解",还是在"回忆"?

数据污染不是一个技术瑕疵,而是对整个评估范式的根本性质疑:如果我们无法保证评测内容对模型而言是"未知的",那么分数还有任何意义吗?


二、同质化危机:当我们用同一把尺子丈量所有 AI

2.1 单一维度的暴力

当前主流的 AI 评估体系,几乎完全是英语学术语境的产物。这种同质化表现在多个层面:

维度当前主流评估的偏向严重缺失的能力
语言英语为主多语言推理、低资源语言能力
领域STEM、人文通识艺术创作、情感交互、伦理判断
任务闭卷答题、单步推理长程任务、多轮协作
价值观西方学术规范多元文化理解、地方性知识

当我们用同一套基准评估所有模型时,得到的是一种"扁平化的能力地图"——地图上标注得最清晰的,恰恰是我们最容易测量的东西;而真正重要的能力,却因为难以量化而被系统性地忽视。

2.2 排行榜的幻觉

HuggingFace、OpenLLM Leaderboard、LMSYS Chatbot Arena 等公开排行榜的出现,本意是促进透明化,却产生了意想不到的反效果:排行榜的可见性,让"分数优化"成为模型开发中最具性价比的策略

一个典型案例是过度拟合 HumanEval。这原本是一个用于评估代码生成能力的小型数据集,但随着它在排行榜上的权重不断攀升,针对它的优化手段也花样翻新。最终的结果是:HumanEval 上的提升,已经无法真实反映模型在实际编程场景中的能力进步。

2.3 同质化的根源:评估者的利益绑定

更深层的问题在于,评估体系的制定者与被评估者之间存在严重的利益绑定。基准创建者常常与头部模型公司保持密切合作,论文署名、商业赞助、技术咨询关系屡见不鲜。这种结构性的亲密关系,使得评估标准难以保持必要的批判性距离。


三、AGI 营销泡沫:当"超级智能"成为销售话术

3.1 概念通胀的轨迹

"AGI"这个曾经严肃的学术术语,正经历着前所未有的概念通胀:

  • 2020 年前:AGI 指代具备人类水平通用认知能力的假设性系统,是严肃的研究目标
  • 2023 年后:被频繁用于描述"在某些任务上超越人类"的现有模型
  • 2024-2025 年:进一步降格为产品宣传语,出现在每一次模型发布的新闻稿中

某头部公司甚至提出"AGI 将在 18 个月内到来"的预测,却在六个月后用同样的数字描述其下一代模型。这种时间表的任意滑动,暴露了"AGI"作为营销话术的真实本质。

3.2 能力宣传的修辞学

仔细审视当前的 AGI 营销话语,可以识别出一套高度程式化的修辞结构:

"X 模型首次实现了 Y 能力"
"在 Z 基准上达到了前所未有的水平"
"距离 AGI 又近了一步"

这套修辞的关键技巧在于用技术细节的真实性掩盖整体叙事的可疑性。每一个具体的分数都可能是准确的,但将其组装成"我们正在迈向 AGI"的故事时,却存在大量的逻辑跳跃。

3.3 资本市场的反馈循环

更值得警惕的是 AGI 叙事与资本市场的相互强化。数千亿美元的 AI 投资,其合理性很大程度上依赖于"通往 AGI 的清晰路径"这一假设。一旦这个假设动摇,整个估值体系都将面临重估压力。

这解释了为什么即便业界内部对 AGI 时间表存在巨大分歧,公开叙事却始终保持乐观。AGI 已经不只是技术目标,更是一种金融资产定价的锚点。


四、批判反思:我们需要什么样的 AI 评估

4.1 走出"分数崇拜"

建立健康的评估文化,首先需要承认一个朴素的事实:任何单一数字都无法捕捉智能的复杂性。就像我们不会用同一个数字评价学生的数学、绘画和领导力一样,对 AI 系统的评估也必须是多维度的。

4.2 走向动态评估

未来评估体系需要实现几个关键转向:

  • 从静态到动态:使用未被模型见过的真实任务,而非反复刷同一批测试集
  • 从单轮到多轮:评估持续交互中的能力表现,而非单次问答的成绩
  • 从纸面到场景:在真实生产环境中测试模型,而非人造学术场景
  • 从通用到垂直:承认不同应用场景需要不同的能力组合

4.3 建立独立的评估基础设施

最根本的变革,在于让评估机构与被评估方保持必要的距离。这需要:

  1. 资金来源的多元化:避免评估机构过度依赖单一公司资助
  2. 数据保密机制的完善:基准数据应当保持对模型训练的"不可见性"
  3. 负面结果的发表空间:学术界应当鼓励对主流模型提出局限性的研究
  4. 跨学科的评估视角:纳入认知科学、社会学、伦理学等多个维度的评估维度

结语:在数字之外重新理解智能

基准测试不是敌人,它们在 AI 发展中扮演过重要角色。但当我们将某项测评结果视为能力的全部,当我们将排行榜的位置等同于研究的质量,当我们让营销叙事取代严谨的批判——评估体系就从工具异化为桎梏。

真正的进步,或许来自于敢于承认一个略显尴尬的事实:我们至今没有一个好的方式来衡量我们正在创造的东西究竟是什么。这种诚实的谦逊,比任何夸大的能力宣称都更接近智能的本质。

泡沫总会破裂。但当它破裂时,我们希望留下的不是废墟,而是一套更清醒、更诚实、更具包容性的 AI 评估范式——以及在这个范式指引下,AI 真正的、扎实的进步。