🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 科技 采集 2026-07-29T04:05:46+00:00

摩尔线程宣布完成 Kimi K3 适配:MTT S5000 国产 GPU 支撑 2.8 万亿参数大模型

来源
ithome
发布时间
2026-07-29T03:00:21
采集批次
2026-07-29-04
字数
1252
URL 指纹
558ef52038fd249d

📌 AI 总结(231 字)

月之暗面于7月28日正式开源Kimi K3模型,总参数量达2.8万亿,是全球首个开源的3万亿级别模型。该模型采用KDA混合线性注意力机制与Stable Latent MoE架构,原生支持视觉理解及100万token上下文窗口。同日,摩尔线程基于MTT S5000训推一体智算卡及MUSA软件栈,宣布完成Kimi K3的Day0支持,涵盖模型结构解析、权重加载、分布式推理链路等全栈适配,无需离线转换即可快速启动推理,标志着国产AI芯片对新架构模型的快速响应能力。
📄 正文(1252 字)
IT之家7 月 29 日消息,月之暗面 7 月 28 日正式开源 2.8 万亿参数模型 Kimi K3 并发布模型权重与技术报告。

同日,摩尔线程基于 AI 训推一体智算卡 MTT S5000 及 MUSA 软件栈,宣布完成 Kimi K3 的 Day-0 支持。

Kimi K3 是全球首个开源的 3 万亿级别模型,总参数达 2.8 万亿,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,采用 Gated MLA 与 Stable Latent MoE 等架构创新,原生支持视觉理解,并拥有 100 万 token 上下文窗口。

与传统 Transformer 模型不同,Kimi K3 的 69 层 KDA 与 24 层 Gated MLA 构成混合注意力主干,Stable Latent MoE 以 896 个专家、每个 token 激活 16 个专家的方式提升模型容量。

面对新架构对 AI 芯片软件栈提出的系统性挑战,摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配。针对 KDA 核心创新,团队分别完成了 Prefill 与 Decode 阶段的关键路径适配,并以 Triton MUSA 正确性实现作为稳定基线。SGLang-MUSA 同步适配了 Hybrid State Pool,用于管理 KDA 递归状态与卷积状态,覆盖 Prefix Cache、分块 Prefill 及 PD 分离场景所需的状态生命周期。

针对 Stable Latent MoE 的 896 专家、TopK 16 激活规模,摩尔线程快速完成了 DeepEP 适配,打通 token dispatch、combine 与跨卡 All-to-All 通信链路。MUSA 软件栈进一步完成模型路由、专家映射和分布式执行链路适配,通过 MCCL、DeepEP 与 MTSHMEM 协同承载张量并行、专家并行和低时延通信。面对 Kimi K3 官方 MXFP4 checkpoint,摩尔线程设计了加载期在线逐层量化方案,无需离线转换即可快速拉起推理。

IT之家查询获悉,MTT S5000 是摩尔线程基于第四代“平湖”芯片架构打造的 AI 训推一体智算卡,单卡 AI 稠密算力最高可达 1000TFLOPS,配备 80GB 显存,显存带宽达 1.6TB/s,卡间互联带宽为 784GB/s,完整支持从 FP8 到 FP64 的全精度计算。

相关阅读:

《Day0 适配:阿里云灵骏真武 M890 超节点实例现已支持月之暗面 Kimi K3 大模型》

《月之暗面开源 Kimi K3 模型,2.8 万亿参数》

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家所有文章均包含本声明。