文 | AIX财经,作者 | 雷晶,编辑 | 金玙璠
在大模型领域,有一条不成文的规矩:新品发布可以延后,但排行榜上的捷报绝对不能少。一份亮眼的成绩单,早已成为新模型亮相的标配。然而,这份成绩单的真实分量,究竟经得起多少推敲?
去年四月,Meta推出Llama 4 Maverick模型,在LMArena(原Chatbot Arena)的盲测中,凭借1417分的ELO评分空降第二名,仅居于Gemini 2.5 Pro之后。但很快,一篇题为《The Leaderboard Illusion》的学术论文揭开了谜底:Meta在正式发布前,私下测试了至少27个模型变体,只挑出表现最好的一个公之于众。而真正落到开发者手中的开源版本,排名从第二暴跌至第三十二。更讽刺的是,Meta提交的“Llama-4-Maverick-03-26-Experimental”本身就是特地为对话风格优化的实验版本,回复啰嗦且堆满表情符号。当LMArena开启“风格控制”功能进行过滤后,它便从第二名滑落到第五名。
这绝非个例。类似的“登顶”“霸榜”新闻,几乎每隔几周就掀起一轮高潮。今年五月,阿里通义千问Qwen 3.7-Max在全球编程盲测榜Code Arena上冲到第二,位居国产模型之首;六月,阶跃星辰的Step 3.7 Flash模型在Artificial Analysis榜单上摘得输出速度桂冠,达到409 tokens/s,其他速度指标同样名列前茅。新模型发布必带榜单战报,这已成了固定流程。
排行榜本该是用户选择模型最可靠的指南,但问题在于,其排名的可信度正愈发受到质疑。
每当一个新模型问世,总伴随着“榜单前列”“能力比肩海外顶尖水准”这类话术来为其背书,可用户的真实感受却是:模型分数越刷越高,而“哪个更好用”的答案却越来越模糊。
模型榜单还有多少借鉴意义?一个模型是否好用,到底该如何评判?
01. 一张榜单是怎样生成的?
首先来看看模型的排名是如何确定的。
排名源于“考试”。业内人士将衡量模型性能的测试统称为基准测试(Benchmark),这是一套标准化的试题,由学术机构、公司甚至个人设计,用固定的题目和评分规则来检验模型在特定任务上的水平。模型完成测试、获取分数后,再依分数高低排列次序,就构成了广义上的榜单。
当下的基准测试大致分为两大类:
一类是离线测试,拥有固定题库,模型作答,系统依据标准答案评分。MMLU、GPQA、HumanEval等均属这一路线。其最大优点是量化清晰、便于横向比较。但题库是公开的,这意味着厂商可以提前“做题”。
另一类是在线测试,常被称作Arena(竞技场)。它没有预设题目,也无标准答案。用户提交问题时,系统会匿名发送给两个模型,用户对比两者的回复后投出自己的一票,平台再将这些投票转化成动态排名。
LMArena就是这个竞技场里的主流选手,由加州大学伯克利分校等机构发起的LMSYS组织创建,众多厂商直接引用其排名来佐证模型实力。它最大的亮点是贴近真实使用感知,但短板同样突出:用户评判带着主观色彩,曾有研究表明,用户容易偏爱篇幅更长、“看起来更专业”的答复。
某美企AI出海业务负责人曾小健指出,在中文环境里,榜单和基准测试常常被一概而论,不少业内人士也不特意区分。日常这么提问题不大,但严格来看,两者确有不同:基准测试是指一套评估任务,回答的是“如何测”的问题;而榜单是基于测试结果生成的排名,解决的是“怎样排”的问题,而且有些榜单还会实时或近实时地迭代,融入用户投票、模型对战等机制。
简单来说,离线测试像高考,有标准答案;在线测试像选秀,靠观众投票。本文不硬性区分这两个词,但明白“固定考试”与“实时擂台”这两种机理的区别,有助于读懂排名背后的意义。
搞清了考试方式,还得知道出题者是谁。眼下的离线基准测试按源头大致可归为三类:
第一类是学术型,题库由高校或研究机构设计,如MMLU、GSM8K等,专业性更强,但更新节奏慢,部分已接近性能天花板。
第二类是厂商型,题库由模型公司自行发布,比如OpenAI的HumanEval(代码能力测试),更贴近实际应用场景,可出题方本身同时也是参赛者,客观性难免受质疑。
第三类是第三方独立型,由独立机构出题并运营,它们通过整合多个维度的评测数据、按权重给出综合评分,例如SuperCLUE、LiveBench等。这类测试立场相对中立,但权重分配、评分规则仍由平台一手把控,透明度有限。
清楚了怎么考、谁出题,还要弄明白这些榜单考察的是什么能力。
离线答题偏重学科知识与基础推理,竞技场盲测则偏重对话体验与人类偏好。为了更直观地理解,我们梳理了一张ag贵宾会式的图表,将主流榜单按类型和考察能力进行了归纳。

从中可以看出,想了解模型编码能力强弱,可以看LiveCodeBench、SWE-bench verifed等;想知晓推理能力高低,可以关注HLE、MMMU等;想评估智能体能力,则可参考GAIA、TerminalBench 2.0等榜单。这些也是当前国内大模型厂商发布模型时最常引用的排行。
也就是说,在选择模型时,可以依据自己关心的能力方向去“对号入座”。
02. 模型榜单也会走样
大模型榜单,原是指引用户挑选模型的显明路标,但越来越多人发觉,考场上的高分选手,实际用起来未必尽如人意。
第一大问题是分数膨胀。伴随模型能力迅速迭代,主流基准测试的“试卷”难度已跟不上模型进化的节奏,在部分测试中,头部模型的成绩集体逼近满分,如此便很难拉开真实差距。
北京理工大学博士生李岩举例说,典型的数学应用题基准GSM8K,在两三年前还是衡量模型推理能力的硬指标,如今几乎所有主流模型都能斩获高分,它也就丧失了筛选力。另一个典型是MMLU,顶尖模型的准确率早已跨过90%,趋于饱和。
第二大问题是刷榜已成行业潜规则。目前的主流榜单如MMLU、C-Eval等,测试题与标准答案大都是公开的,厂商能够获取公开试卷并实施定向训练。
李岩提到,业内的刷榜主要分两种:一是用原题或高相似度的改编题训练,要么直接针对测试原题,要么简单调整数据参数,模型无异于“背题应试”;二是考点拆解式专项训练,避开原题,而是拆解试题核心知识点,合成同类数据来训练,类似“刷模拟卷”。
第三大问题是考题与真实使用场景相脱节。当前的榜单多为标准化试题,侧重知识记忆与标准答案匹配,但用户的真实需求远比考题繁复。大模型从业者陈楚表示,模型训练时都以榜单高分为目标,可高分不等于会做事。在实际业务中,问题不一定有唯一的标准答案,场景也更加多元,一个模型是否趁手,很难单凭“考试成绩”来判定。
曾小健打了一个比方,榜单好比一支温度计,刷榜就相当于在温度计旁架了一盆炭火,测出的其实是火盆的温度,而用户感受到的是整个房间的体感温度,自然没那么高。榜单测的是一个点,用户感知的是整个场景,落差由此产生。
这三大问题交织在一起,便解释了为何榜单上的“尖子生”,到了真实环境里可能会“水土不服”。
此外,榜单的公信力也曾引发争议。国内第三方评测机构SuperCLUE在2023年5月发布的榜单中,将科大讯飞的星火大模型排到第四名,仅次于Anthropic和OpenAI的两个模型版本。随后网友发现,其官网顾问名单的首位是哈工大讯飞联合实验室的研究员,榜单成绩的客观性由此蒙上阴影。
因此,看榜之前,需要学会判断一张榜单是否可信。重点拿捏两个方面:一是出身,测试套件是否公开透明,是否由模型厂商或盈利机构自行操控。曾小健指出,市面上不乏各种“野榜”,有些评测机构本身就带商业属性,靠发布榜单、撰写软文来实现变现,评测方法不透明,样本和流程也不公开,宣称某些模型表现更优,却拿不出令人信服的凭据。
二是题库的新鲜度,如果主流模型得分普遍趋近满分,说明这套考题已经过气,区分度不足。李岩认为,随着旧数据集日渐失效,学术界也在持续推出难度更高的评测集,榜单自身的更迭同样在倒逼模型突破能力瓶颈。
03. 什么样的模型才算好用?
随着大模型迈向商业落地,榜单排名牵涉的利益链条只会越拉越长,围绕榜单的争议也不会停歇。这样一来,就不光要会“看”榜单,更要能读懂榜单所传递的信息。
当前主流基准测试已细分出数学推理、代码生成、知识问答、长文本理解等众多维度。一个在代码榜上领先的模型,未必擅长写营销文案;一个知识问答拿高分的模型,处理长文档时可能力有未逮。
这里我们也根据主流榜单官网公示的数据,整理了一份模型排名概览,帮助大家像了解ag贵宾会一样快速把握全局。需要留意的是,榜单数据更新存在延迟,且随时可能生变,这里截取的是截至发稿时的状态,仅供读者参考。

不难看出,Google的Gemini系列是目前覆盖最全面的“全能型选手”;OpenAI和Anthropic则各擅胜场,OpenAI的模型推理能力更胜一筹,而Anthropic更擅长任务语言理解。
国内厂商则在特定赛道上占据一席之地。其中,DeepSeek的V3.2 Speciale和智谱的GLM-4.7双双闯入LiveCodeBench编码能力榜前五;MiniMax的M3模型跃入GPQA Diamond推理榜;而在视频与图像生成领域,字节跳动的 Seedance 2.0、阿里巴巴的HappyHorse1.0、快手的Kling 3.0等国产模型已担当主力。
一个更加显著的趋势是,没有任何一个模型能包揽所有榜单的冠军。如果留意各家厂商的技术报告或发布会,就会发现一个规律:模型在哪个方向有所突破,就重点亮出对应的榜单战绩,一些厂商还会在一个综合榜单上特意拎出自己领先的若干子项,用局部优势来印证整体实力。
这也及时提醒我们,不要只盯着单一榜单的位次,尤其当两款模型的分数区间相近时,排名先后几乎没有实质参考意义。同时,场景不同,对“好模型”的界定也截然不同,所以要首先明确自身需求,再去搜寻对应领域的榜单,而不是只抱着一张综合排行看总分。
所以,看榜的核心准则就是:多来源、多维度、动态观察。挑选几个不同出处、不同题库的榜单进行交叉验证,只有当结论趋于一致时,才更可信。
除了参照榜单,又该如何判别一个模型好不好用?
陈楚认为,评估一个模型不能仅看准确性,还要瞧它面对意外输入时会不会犯错、在陌生任务上表现是否稳健、推理速度和资源耗费是否在可接受范围。
他的做法是先借助榜单进行初筛,再依据自己的使用需求定制相应的基准测试,把新旧模型放在真实环境里并行运行一段时间,观察实际效果的差异。
对普通用户而言,不必这么繁复,但逻辑是相通的。李岩建议,可以选出几个自己日常工作中反复出现的任务,比如做PPT、写周报、整理资料等,分别让不同模型跑一遍,并将结果进行横向比较。此外,关注各类科技媒体的测评也是一种低成本、见效快的参考路径。
曾小健则认为普通用户无需过度钻研榜单,跟着个人习惯和实际体验走就行。但对专业从业者,他再三强调真实测试的重要性。在他看来,榜单只能提供有限的参照,更多的判断还得靠实际业务场景中的测试来验证。
模型能不能干好活儿,终究要上手一试。先收窄候选范围,再把模型放入自己的业务情境中跑任务,看它表现究竟如何,这是当前业内的普遍共识。
应受访者要求,文中李岩、陈楚为化名。