大模型Arena周榜:两款国产模型发力,glm‑5.3‑max首秀出彩,kimi‑k3‑max闯入前十

时间:2026-08-26来源:互联网作者:down

      Arena平台发布2026年第34周A1大模型盲测榜单,智谱glm‑5.3‑max首次上榜位列综合榜第13名,月之暗面kimi‑k3‑max升至第10名,闯入综合榜前十。本周多款国产模型在细分榜单表现出色,新模型大量入榜,行业竞争格局发生变动。榜单基于匿名盲测投票,以ELO计算排名,智能体榜采用百分比信号,仅反映用户主观偏好。各分榜相互独立不可跨榜对比,误差范围内分数视为并列,新模型需积累投票数据方可正式入榜。


      综合榜

      综合榜头部格局保持稳定,claude‑fable‑5以1508分蝉联第一,claude‑opus‑4‑6‑high、claude‑opus‑4‑7‑high分列二、三名,三者分差不到30分,实力接近。本周榜单变化显著,glm‑5.3‑max新上榜位列13名,kimi‑k3‑max上升两位首次进入前十,muse‑spark‑1.1上涨3位排第8。gpt‑5.5‑instant、claude‑opus‑4‑8初次入榜排在28、29名,qwen3.8‑max则从第8名下滑至第19名。

      多款国产模型占据榜单中上游位置,整体发挥平稳:

      月之暗面kimi-k3-max,ELO分数1489分,排名第10,相比上周提升2位

      智谱glm-5.3-max,ELO分数1487分,排名第13,属于首次登上榜单

      阿里qwen3.8-max,ELO分数1481分,排名第19,较上周下跌11位

      阿里qwen3.7-max-preview,ELO分数1474分,排名第27,排名基本没有变化

      代码榜

      代码榜头部排名小幅调整,claude-opus-4-7-high登顶榜首,claude-opus-4-6-high、claude-fable-5分列二、三名,三者分数仅差1分,误差范围内成绩持平。智谱glm-5.3-max首次入驻代码榜便跻身前十,表现优异。另有多款模型全新入榜,同时阿里qwen3.8-max排名大幅下滑,名次降幅明显。

      有多款国产模型进入代码榜前三十,详细排名如下:

      月之暗面kimi-k3-max,第6名,ELO1542分,排名基本持平

      智谱glm-5.3-max,第10名,ELO1531分,首次入榜

      阿里qwen3.7-max-preview,第17名,ELO1524分,排名基本持平

      阿里qwen3.8-max,第 25名,ELO1520分,较上周下降12位

      小米 mimo-v2.5-pro,第 27名,ELO1519分,排名基本持平

      前端开发榜

      前端开发榜头部格局依旧保持稳定,claude‑opus‑5‑max以1691分守住榜首位置,实现蝉联。国产模型kimi‑k3‑max、qwen3.8‑max稳定拿下第二、三名,ELO分数分别为1674分、1669分,和第一名分差小于30分,在误差范围内实力相近。新上榜的glm‑5.3‑max直接排到第8名,qwen3.8‑27b首次入榜位列第9名,两款国产新模型全部闯入前十,表现十分亮眼。现阶段已有多款国产模型跻身榜单前十五,在前端开发赛道展现出强劲的竞争实力。

      AI 生图榜

      AI生图榜头部格局保持稳定,gpt‑image‑2 (medium)以1381分继续位居榜首。国产模型seedream‑5.0‑pro稳定排在第8名,qwen‑image‑3.0‑pro位列第9名,两款国产模型双双进入前十,排名没有出现较大起伏。hunyuan‑image‑3.0本周上升至第29名,依旧留在榜单前三十之内。

      AI 视频榜

      AI视频榜当中,字节跳动全新推出的dreamina‑seedance‑2.5‑720p首次入榜就拿到第4名,ELO分数1477分,排在它的前代版本dreamina‑seedance‑2.0‑720p之后,两款国产模型一同跻身榜单前五,整体表现十分突出。gemini‑omni‑flash依旧以1512分占据榜首位置,flux‑3‑video位列第二名,dreamina‑seedance‑2.0‑720p维持第三名不变。

      智能体榜

      智能体榜头部仍由Anthropic的模型占据,Claude Opus 5(High)凭借12.47%净提升度位居第一,Claude Opus 5(Max)升至第二,Claude Fable 5(High)跌至第三,三者数据处于误差区间,实力接近。月之暗面Kimi K3(Max)上升一位位列第四,正式踏入头部梯队。DeepSeek V4 Pro(High)(0813)与Qwen3.8 Max两款国产模型首次上榜,分列14、15名。

      多款国产模型闯入智能体榜前三十,头部选手已经触及第一梯队的门槛,具体数据如下:

      月之暗面KimiK3(Max),排名第4,净提升度10.41%,任务确认成功率17.97%,较上周提升1位

      深度求索DeepSeek V4 Pro(High)(0813),排名第14,净提升度6.26%,任务确认成功率13.06%,首次入榜

      阿里Qwen3.8Max,排名第15,净提升度6.20%,工具幻觉率仅0.18%,首次入榜

      智谱GLM5.2(Max),排名第17,净提升度5.82%,较上周下滑3位

      深度求索Deepseek V4 Flash(High)(20260731),排名第 20,净提升度3.99%

      本周Arena榜单迎来多款国产新模型。智谱glm‑5.3‑max在综合、代码、前端开发榜单均取得不错成绩,月之暗面kimi‑k3‑max进入综合榜前十、智能体榜前四,字节跳动dreamina‑seedance‑2.5‑720p跻身AI视频榜前五,国产大模型多赛道实现突破。未来国产大模型新版本将陆续发布,榜单竞争或将进一步加剧,值得持续关注。

相关文章 更多>>

热门推荐