ithome
科技
采集 2026-08-26T16:14:20+00:00
阿里通义千问发布Qwen3.8-Flash开源模型
原始标题:阿里通义 Qwen3.8-Flash(Next)发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9
来源
ithome
发布时间
2026-08-26T12:39:50
采集批次
2026-08-26-16
字数
1051
URL 指纹
3731d7cd7deaec97
📌 AI 总结(249 字)
阿里通义千问团队正式发布Qwen3.8-Flash多模态MoE模型,主模型参数量125B,每token激活6B参数,原生支持26万tokens上下文并可扩展至100万。该模型在注意力机制、残差流、Embedding和优化策略四个方向进行系统升级,训练成本仅为前代Qwen3.7-Plus的九分之一。基准测试中,Qwen3.8-Flash-Next-Base在14项评测中的8项取得最优结果。该模型即将上线千问AI平台并提供API服务,权重已在Hugging Face和ModelScope同步开源。
📄 正文(1051 字)
阿里通义千问团队正式发布了Qwen3.8-Flash,并同步开源了Qwen3.8-Flash-Next的权重,该新架构被视为下一代Qwen4系列模型的雏形。 Qwen3.8-Flash是一个多模态MoE模型,主模型参数量为125B,额外配备51B的N-gram Embedding,每token激活6B参数。它原生支持262,144 tokens上下文,并可通过YaRN扩展至1M tokens。 据介绍,Qwen3.8-Flash围绕四个方向进行了系统升级: 在Attention方面,采用GDN(Gated DeltaNet)与QSA(Qwen Sparse Attention)混合架构。GDN负责高效压缩历史信息,QSA则通过轻量级Indexer在micro-block粒度上筛选重要上下文,显著降低长序列Attention开销。面对1M token的超长上下文,QSA的Attention Kernel在Prefill和Decode阶段分别实现最高7.6倍和4.9倍的加速。 在Residual方面,引入Gated Residual(GR)机制,将残差流扩展为4条并行分支,通过动态Gate控制信息读写。残差状态支持FP8存储,大幅降低访存开销。 在Embedding方面,引入51B参数的N-gram Embedding,利用局部上下文查表扩展模型容量。这些参数可卸载至Host Memory,通过异步Prefetch与模型计算重叠,不长期占用GPU显存。 在Optimization方面,采用Muon Optimizer,并针对正交化精度、参数分工及融合矩阵拆分等策略进行优化。针对新架构重新拟合了Scaling Law。 相比Qwen3.7-Plus,Qwen3.8-Flash的训练成本仅约为前者的九分之一,但在编码和办公任务上具备更强能力。 在6B激活参数下,Qwen3.8-Flash-Next-Base在14个benchmark中的8个上取得最优结果,包括MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM与MMMU。 Qwen3.8-Flash即将上线千问AI平台,对外提供API服务,定价为每百万Tokens输入1元、输出3元。模型权重已于北京时间8月26日23点在Hugging Face与ModelScope平台开源,同步发布FP8量化版本。Qwen3.8-Flash-Next默认支持1M上下文并内置官方工具。