科技·商业·财经

中国大模型“第一”之争:Kimi K3与Qwen3.8-Max双雄格局谁更胜一筹?

   时间:2026-09-01 13:11 作者:江紫萱

当前,中国大模型领域正上演一场独特的“第一”争夺战。几乎每家头部企业都宣称自家模型是“中国第一”甚至“全球前三”,这种热闹景象背后,实则是各家精心挑选定语的结果。参数最大、单项基准领先、盲测榜夺冠……不同的定语下,每个“第一”似乎都站得住脚,却又难以形成统一认知,如同智能手机时代厂商们纷纷标榜“跑分第一”“拍照第一”,新能源汽车领域则充斥着“续航第一”“智驾第一”等说法。

与中国的热闹景象不同,美国大模型行业已形成相对公认的格局。不同阶段,OpenAI、Anthropic的Claude、Google的Gemini等轮流领跑。2026年年中,共识是Anthropic重新占据优势,其Claude Fable 5在Artificial Analysis智能指数上以约60分位居榜首,GPT - 5.6 Sol以约59分紧随其后。这一共识由第三方评测机构、开发者社区和真实使用数据共同塑造,无需依赖企业发布会。

中国未能形成类似共识,并非没有答案,而是被公关宣传的声浪掩盖。为探寻事实真相,我们主要借助三类权威第三方验证数据——Arena全球盲测、Artificial Analysis智能指数与SuperCLUE中文测评进行交叉分析。

Artificial Analysis(AA)是国际开发者社区广泛引用的独立评测机构,其智能指数综合数学、推理、代码、知识等多维度标准化测试,全球189款模型同台竞技,测试口径统一且不收取厂商费用,是目前最接近“客观”的第三方标尺。截至2026年8月初,中国主要模型成绩如下:月之暗面Kimi K3(Max)得57分,在189款模型中排第四,是开源权重模型历史最高排名,超越Claude Opus 4.8(约56分),仅次于Claude Fable 5(约60分)、GPT - 5.6 Sol(约59分)和谷歌一款旗舰;智谱GLM - 5.2(Max)得51分,排名十名开外;深度求索DeepSeek V4 Flash 0731得50分,与谷歌Gemini 3.6 Flash持平;阿里Qwen3.8 - Max暂无成绩,其上一代Qwen3.7 - Max验证成绩为56.6分。这表明中国最强模型已接近全球第一梯队,且“官方最强”与“验证最强”存在差异。

Arena(arena.ai)采用人类盲测机制,两个匿名模型回答同一问题,用户投票,数百万张投票换算成ELO积分,衡量的是“真人觉得谁更好用”。2026年8月第33周榜单显示,综合榜中Anthropic的Claude系列包揽前五,国产模型里Qwen3.8 - Max排第8(ELO 1491),Kimi K3 Max排第12(1489),是仅有的两家进入前十五的中国模型,二者分差仅2分,在误差范围内基本并列,但Qwen3.8 - Max位置更靠前。代码榜中,Kimi K3 Max排第6(1544分),是排名最高的国产代码模型,Qwen3.8 - Max排第13,小米Mimo排第25。前端开发榜上,Kimi K3 Max以1674分排第2,仅落后榜首的Claude Opus 5 Max(1692分)18分,Qwen3.8 - Max排第3(1667分),智谱GLM - 5.2 - Max排第9,DeepSeek V4 Pro新入榜即排第10,一个月前Kimi K3刚发布时曾以1679分短暂登顶该榜单。智能体榜中,Kimi K3 Max以10.60%的净提升度排第5,与Claude Opus系列同处全球第一梯队,Qwen3.8 Max新入榜排第11,GLM 5.2 Max排第14,DeepSeek V4 Flash排第19。综合来看,Kimi K3 Max覆盖面广、位置高,Qwen3.8 - Max综合榜位置高但在代码、智能体实战榜单上落后。

SuperCLUE是中文场景下极具公信力的第三方基准之一。2026年7月榜单上,12款国产主流模型综合总分排名为:Qwen3.8 - Max、Kimi - K3、豆包Doubao - Seed - 2.1 - Pro与DeepSeek - V4 - Flash,第一和第二分差小但顺序明确,Qwen3.8 - Max在中文综合能力上排第一,与Arena综合榜表现相互印证。值得注意的是,字节豆包2.1 - Pro在中文综合测评中排第三,是“五强”中唯一未参加Arena国际盲测的模型,能力在国内榜单可见,国际坐标系里缺失;DeepSeek排在第四,曾经的领跑者位置已被后来者取代。编程专项上,SuperCLUE给出不同答案,GLM - 5.2以64.13分断层领先,Kimi K2.7 - Code得55.43分,智谱是典型的“偏科生”,单项编程全球第一,综合能力却排不进国内前四。

2026年夏天,五家大模型在六周内密集发布前沿模型。6月中旬智谱GLM - 5.2发布,7月16日Kimi K3发布,7月19日Qwen3.8 - Max预览,7月27日Kimi K3开源,7月31日DeepSeek V4 Flash 0731发布,8月3日Qwen3.8 - Max正式版发布。此时出现三个事实:百万token上下文成旗舰标配,五家全部支持;2万亿参数级模型全部选择开源(MIT协议),这是中国公司对全球开源社区的贡献,也是对美国闭源路线的差异化竞争;同为旗舰,输出价格差50倍,Kimi K3输出定价100元/百万token,是DeepSeek V4 Flash的50倍,这是商业模式的选择,Kimi K3用高价格匹配强推理密度,DeepSeek用低价换取Agent高频调用市场。

综合三条证据链,2026年8月中国大模型五强格局逐渐清晰。月之暗面Kimi K3是验证维度上的中国第一,7月16日发布,7月27日开源,2.8万亿参数、104B激活,是人类历史上参数规模最大的开源模型,也是全球第一个原生支持文本、图像、音频、视频四模态的万亿级开源模型。其第三方成绩单完整,AA智能指数57分(开源史上最高、全球第4、超过Claude Opus 4.8),Arena前端第2、代码第6、智能体第5,SuperCLUE中文第二,第三方评测机构FireworksAI在1030个真实Agent任务上的实测显示,Kimi K3表现接近Claude Fable 5,成本约为其1/50,短板是价格高。阿里Qwen3.8 - Max是中文综合与生态上的第一,2.4万亿参数、95B激活,8月3日正式版发布,是SuperCLUE中文综合第一、Arena综合榜国产最高(第8),但国际验证成绩单空白,AA智能指数未评测,官方基准全部来自阿里自己,其真正护城河在于Qwen开源家族数年积累的全球下载量第一、衍生模型生态最厚。深度求索DeepSeek V4是推理与性价比之王,但已被反超,2025年初DeepSeek R1以极低训练成本逼近当时OpenAI顶级模型,引发硅谷震动,此后节奏变慢,2026年8月中旬一项对8款主流模型的独立横评(API实测)中,DeepSeek V4 Pro以9.1分排在所有国产模型之首,全场仅次于Claude Opus 4.8(9.20),推理单项9.5分超过GPT - 5.6,“识别条件不足、知道何时不该下结论”的能力被评为全场最强,SWE - bench Verified约80.6%是国产模型中可查证的最高标准化跑分,V4 Flash(284B/13B激活)把输出价格压到2元/百万token,约为Claude Opus的1%,是Agent高频调用场景的默认选项,但AA智能指数是50分,综合排名已被Kimi K3和Qwen3.8 - Max甩开。智谱GLM - 5.2是编程特长生,约744B参数,MIT开源,基于华为昇腾训练,在Code Arena、Design Arena两个国际编程盲测榜上拿过全球第1,SuperCLUE编程专项断层领先,但综合能力(AA 51分、Arena智能体第14)与第一梯队有明显差距,独立横评中推理任务表现曾翻车。字节豆包2.1 - Pro是用户规模第一,国际验证缺位,SuperCLUE中文综合第三,响应速度全场最快(首字延迟约380毫秒),背靠豆包App国内最大的AI用户盘子,字节内部正在推进五万亿参数超大模型的前期论证,但它缺席Arena国际盲测,AA指数也查无此模型。

中国大模型“人人第一”乱象的背后,是各家选择对自己最有利的坐标系。阿里说“盲测仅次于Claude”,用的是Arena综合榜;月之暗面说“全球最强开源”,用的是参数规模和AA指数;智谱说“全球第一”,用的是Code Arena;DeepSeek说“SWE - bench 80.6%”,用的是单一标准化基准;字节说“金牌、全球领先”,用的是竞赛成绩和自建基准。美国行业虽也存在营销,但被Artificial Analysis、Arena等成熟第三方评测机构以及开发者社区的舆论场压制。在中国,评测基础设施正在补齐,但公关宣传音量仍大于榜单音量。判断“第一”宣称时,可先问三个问题:这个第一是在哪个坐标系里?这个坐标系是谁定义的?同一坐标系里排第二第三的是谁?

中国第一与世界第一的差距目前是3分(AA指数57对60),但背后差距比看起来大。Kimi K3超过的是Claude Opus 4.8,面对的Claude Fable 5、GPT - 5.6 Sol等仍在快速迭代,Arena第33周榜单上综合榜前五名全部是Anthropic的模型,集中度体现差距。不过,中国模型从“落后一个身位”到“3分之差”只用了一年半,2025年初DeepSeek R1让全球正视中国模型,2026年年中Kimi K3成为全球前五中唯一的非美国模型且开源,在开源半场格局已反转,全球最强开源权重模型、下载量最大开源家族、生态最活跃开源社区都在中国。这场追赶背后,算力是重要变量,GLM - 5.2基于华为昇腾训练,是首个在国际榜单登顶的国产芯片训练模型,DeepSeek从V3开始以“单位算力产出最大化”为第一原则,Kimi K3和Qwen3.8 - Max的万亿级训练也完成于国产算力占比持续提升的集群之上,在美国对高端GPU出口收紧背景下,中国大模型进步是在算力约束下取得的效率创新产物。商业模式与生态差距也常被忽略,Anthropic与OpenAI的领先不仅是模型分数,还有终端产品形成的真实数据飞轮,中国模型在API与开源生态上进展快,但全球级别终端产品尚未出现,豆包用户盘子主要在国内,Kimi和Qwen海外用户以开发者为主。按当下第三方验证,中国最强大模型是Kimi K3;按中文综合与产业生态,是Qwen3.8 - Max,而三个月后答案可能改变,Qwen3.8 - Max的AA评测、DeepSeek的下一代、字节的五万亿参数模型与智谱的下一版模型都在路上,能被全球第三方榜单反复验证的名字才是当下真正的第一。

 
 
更多>同类内容
全站最新
热门内容