🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 国际 科技 采集 2026-08-17T10:11:09+00:00

AI大模型周榜:Anthropic新模型密集入榜,国产kimi稳居前端开发第二

原始标题:AI 大模型周榜:Anthropic 多款模型密集入榜,国产 kimi-k3-max 稳定头部

来源
ithome
发布时间
2026-08-17T08:02:38
采集批次
2026-08-17-10
字数
1749
URL 指纹
481f6d0a15b35eeb

📌 AI 总结(317 字)

Arena平台发布2026年第33周AI大模型盲测排名,Anthropic多款Claude Opus 4系列新模型密集入榜并包揽综合榜前五,Claude Fable 5以1506分蝉联榜首。国产模型方面,月之暗面kimi-k3-max综合排名上升至第12位,前端开发榜稳居第二,qwen3.8-max首次跻身智能体榜Top 10。代码榜同样由Anthropic主导,kimi-k3-max保持国产代码模型最高排名。AI视频榜中Black Forest Labs的flux-3-video新模型首入即拿第二名,国产dreamina-seedance-2.0保持第三。整体来看国产模型在通用能力、智能体等细分领域正稳步缩小与海外头部差距。
📄 正文(1749 字)
IT之家8月17日消息,Arena平台发布2026年第33周AI大模型盲测排名,本期最大看点是Anthropic多款Claude Opus 4系列新模型密集入榜并占据综合榜前五位,国产模型kimi-k3-max排名上升2位至综合榜第12位,在前端开发榜也保持第2位,qwen3.8-max首次跻身智能体榜Top 10。国产模型整体仍处于中上游位置,在前端开发等细分领域已经形成对头部海外模型的紧追态势。

本期综合榜头部几乎被Anthropic新模型包揽,Claude Fable 5以1506分蝉联榜首,新入榜的Claude Opus 4.6 (High)以1505分紧随其后位列第二,同样新入榜的Claude Opus 4.7 (High)以1502分排名第三。前三名分数差距均在5分以内,属于误差范围内的并列。谷歌Gemini 3.7 Flash (High)作为新模型首次入榜即拿到第9名,表现亮眼。

国产模型方面,kimi-k3-max位列第12名,ELO 1489分,较上周上升2位;阿里qwen3.8-max位列第8名,ELO 1491分;阿里qwen3.7-max-preview位列第26名,ELO 1474分。

代码榜格局同样由Anthropic新模型主导,Claude Fable 5以1554分守住榜首,新入榜的Claude Opus 4.7 (High)和Claude Opus 4.6 (High)分别以1552分、1551分占据第二、第三名。kimi-k3-max稳定在第六名,依然是排名最高的国产代码模型。Meta muse-spark-1.2 (xHigh)排名上升7位至第八名,是本周涨幅最大的头部模型。

国产模型在代码榜占据多个中上游席位:kimi-k3-max第6名,阿里qwen3.8-max第13名,阿里qwen3.7-max-preview第17名,小米mimo-v2.5-pro第25名。

前端开发榜头部格局稳定,Claude Opus 5 Max以1692分蝉联第一,国产kimi-k3-max以1674分保持第二名位置,仅落后18分,依然对榜首形成紧逼。阿里qwen3.8-max上升1位至第三名,深度求索的Deepseek V4 Pro (High)作为新模型首次入榜即拿到第10名。

国产模型在前端开发榜占据多个头部和中上游位置:kimi-k3-max第2名,qwen3.8-max第3名,智谱GLM 5.2 Max第9名,Deepseek V4 Pro (High)新入榜第10名,Deepseek V4 Flash (High)第11名。

AI生图榜中,GPT Image 2 (Medium)以1381分继续稳坐榜首,微软新模型MAI Image 2.6 Preview首次入榜就拿到第二名。国产seedream-5.0-pro守住第八名,qwen-image-3.0-pro位列第九名。

AI视频榜头部迎来新变化,Black Forest Labs新模型Flux 3 Video首次入榜即拿到第二名,仅落后榜首Gemini Omni Flash 16分。国产模型dreamina-seedance-2.0-720p保持第三名,minimax-h3位列第五名。

智能体榜中,Anthropic模型继续垄断前三,Claude Opus 5 (High)以12.19%的净提升度守住榜首位置。本次榜单有两款新模型进入前十,其中国产Qwen3.8 Max首次入榜即排名第11位,任务确认成功率12.54%,工具幻觉率仅0.11%,表现亮眼。国产Kimi K3 Max稳定在第五名,任务确认成功率15.55%,已经跻身全球智能体第一梯队。

本周Arena榜单最显著的特征是海外厂商Anthropic集中发布多款新模型并迅速占据各榜单头部位置,验证了其模型迭代的技术积累;国产模型方面,kimi-k3-max在综合、代码、前端开发三个核心榜单均稳定在前15名,前端开发榜更是稳居第二,qwen3.8-max在智能体榜首秀即进入Top 11,整体来看国产大模型在通用能力和智能体领域都在持续推进,与头部海外模型的差距仍在稳步缩小。