🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 国际 科技 采集 2026-09-07T10:12:43+00:00

AI大模型周榜:国产多模型扎堆入榜前端开发榜,阿里wan3.0冲进视频榜前三

原始标题:AI 大模型周榜:国产多模型扎堆入榜前端开发榜,阿里 wan3.0 冲进视频榜前三

来源
ithome
发布时间
2026-09-07T08:34:07
采集批次
2026-09-07-10
字数
1757
URL 指纹
f326b35fe62eb2d9

📌 AI 总结(351 字)

Arena平台发布2026年第36周AI大模型盲测排名,本周多款新模型集中入榜。综合榜头部仍由海外模型主导,claude-fable-5以1507分蝉联榜首,claude-fable-5.1-max首次入榜即列第三。前端开发榜迎来密集新模型,OpenAI gpt-6-astra-max登顶,阿里qwen3.8-max-0902首次入榜冲至第四,腾讯、智谱旗下模型同步进入前十五。AI视频榜方面,阿里wan3.0首次入榜直接跻身前三,与第四名同分视为并列。代码榜由Anthropic三款模型包揽前三,国产kimi-k3-max稳居第六。智能体榜中claude-fable-5.1-max以15.87%的净提升度登顶榜首。整体来看,头部格局仍以海外为主,但国产模型在细分领域进步显著,与头部差距持续缩小。
📄 正文(1757 字)
IT之家9月7日消息,Arena(arena.ai)平台本周发布2026年第36周(8月31日~9月6日)AI大模型盲测排名,本期迎来多个重量级新模型入榜,其中多款国产模型在细分榜单实现亮眼突破。

本期综合榜头部排名整体稳定,claude-fable-5以1507分蝉联榜首,claude-opus-4-6-high以1505分紧随其后,两者分差仅2分,在误差范围内视为接近。本周有两款新模型首次入榜,Anthropic claude-fable-5.1-max直接冲入前三,ELO得分1504分,位列第3;谷歌gemini-3.8-flash-high位列第8,ELO得分1494分,目前仍为preliminary阶段。头部前10名分数均在1492分以上,分差均小于30分,整体竞争非常胶着。

国产模型整体处于中上游位置,梯队相对稳定。月之暗面kimi-k3-max排名最高,位列第12名,ELO 1489分;智谱glm-5.3-max位列第20名,ELO 1482分,较上周下降5位;阿里qwen3.8-max位列第22名,ELO 1480分,排名下降2位。

代码榜头部格局同样稳定,claude-opus-4-7-high和claude-opus-4-6-high同以1552分并列前两位,claude-fable-5以1551分紧随其后,前三名均为Anthropic模型。本周谷歌gemini-3.8-flash-high首次入榜即位列第7,ELO 1537分;OpenAI gpt-5.5-high也首次入榜,位列第28,ELO 1520分。国产模型glm-5.3-flash排名上升2位,来到第9。代码榜中月之暗面kimi-k3-max位列第6名,ELO 1542分;智谱glm-5.3-max位列第16名,ELO 1528分;阿里qwen3.8-max位列第30名,ELO 1520分。

前端开发榜本周迎来密集新模型入榜,OpenAI gpt-6-astra-max首次登榜即拿下榜首,ELO 1797分;Anthropic claude-fable-5.1-max首次入榜位列第二,ELO 1762分。国产模型此次扎堆入榜表现突出,阿里qwen3.8-max-0902首次入榜即冲到第4,ELO 1686分;阿里qwen3.8-flash-next、腾讯hy4-preview、智谱glm-5.3-flash也均首次入榜并杀入前15,分别位列第9、第12、第15。月之暗面kimi-k3-max位列第5名,ELO 1674分。

智能体榜本周迎来新模型claude-fable-5.1-max首次登榜,直接以15.87%的净提升度登顶榜首,原榜首Claude Opus 5(High)以12.68%降至第二。在信号指标方面,claude-opus-4.8(High)工具幻觉率仅0.24%,为头部最低;kimi-k3-max任务确认成功率达到16.58%,在国产模型中领先。腾讯hy4-preview位列第10名,首次入榜;智谱glm-5.2(max)位列第12名,较上周上升4位。

AI生图榜头部格局稳定,gpt-image-2(medium)以1382分蝉联榜首;微软mai-image-2.6首次入榜即拿到第二名,ELO 1332分。国产模型seedream-5.0-pro稳定保持第8,qwen-image-3.0-pro位列第9。

AI视频榜本周最大亮点是阿里wan3.0首次入榜即冲进前三,ELO得分1494分,仅次于谷歌gemini-omni-1.1-flash(1515分)和gemini-omni-flash(1511分),与第四名flux-3-video(1494分)同分,在误差范围内视为并列。国产dreamina-seedance-2.5-720p排名上升一位来到第6,minimax-h3位列第8。

本期Arena周榜的最大看点是大量新模型集中发布并迅速入榜测试,其中国产模型在前端开发、AI生成视频等细分领域实现了突破性排名,多款新模型首次入榜就冲进前十甚至前三,展现出快速迭代的竞争力。头部综合榜仍由海外厂商模型占据,但国产模型与头部的分差正在持续缩小。