🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 科技 采集 2026-09-20T04:10:53+00:00

华为联合中电信发布星辰代码智能体大模型Xing4.0-29B

原始标题:华为:基于昇腾超节点训练的星辰轻量级代码智能体大模型 Xing4.0-29B 发布

来源
ithome
发布时间
2026-09-20T02:24:08
采集批次
2026-09-20-04
字数
1089
URL 指纹
56ee75c1cdf489d9

📌 AI 总结(242 字)

中电信人工智能科技与华为联合发布新一代星辰大模型Xing4.0-29B-A4B,总参数290亿、激活参数仅40亿,是国内首个基于昇腾Atlas 900 A3 SuperPoD液冷超节点与昇思MindSpore框架训练的百亿参数大模型。该模型专为代码开发、数据分析等复杂工程任务优化,支持长上下文处理与多步骤自主规划执行。华为团队从数据基座、架构设计、工程优化和多专家强化学习四个维度进行系统性攻坚,在昇腾超节点上实现训练性能提升96%。目前昇腾已支持40余个业界头部模型完成原生训练。
📄 正文(1089 字)
IT之家9月20日消息,中电信人工智能科技有限公司于9月17日正式发布新一代星辰大模型Xing4.0-29B-A4B。该模型聚焦复杂任务理解、任务规划、工具调用和自主执行等能力,支持长上下文处理,可应用于代码开发、数据分析、办公自动化及生活服务等场景。

华为中国官方昨晚宣布,Xing4.0-29B-A4B总参数29B,激活参数仅4B,是国内首个基于昇腾Atlas 900 A3 SuperPoD液冷超节点与昇思MindSpore框架完成训练的百亿参数大模型,面向复杂工程任务进行了深度优化。

该模型采用新一代架构设计,进一步提升长程任务处理和多步骤执行能力,能够根据用户提出的目标自主规划任务路径、调用工具并完成复杂任务。

华为官方表示,模型的中高阶代码生成与智能体执行,是对长程上下文理解、复杂推理规划、工具调用协同的综合考验。华为团队与中电信团队紧密协同,从数据体系、模型架构、训练工程到强化学习,进行了系统性攻坚。

数据基座方面,围绕预训练与后训练全生命周期,建设涵盖数十万亿词元的数据体系。预训练阶段完成PB级多源异构数据清洗,引入海量智能体行为轨迹与结构化知识图谱。后训练阶段搭建高并发沙箱容器,构建端到端长程任务合成数据,并建立自动化校验机制保障数据正确性。

架构设计方面,专为长程Agent任务设计,MLA多头潜变量注意力压缩KV缓存;MT多Token预测增强生成连贯性;mHC流形约束超连接解决训练数值不稳定的问题;Muon与QK-Clip优化器保障训练稳定。训练采用分阶段递进策略,从4K逐步扩展至32K、128K、256K序列长度,系统性构建长程能力。

工程优化方面,Xing4.0-29B-A4B在昇腾超节点集群上通过多层次软硬件协同优化实现训练性能提升96%。基于MindSpore全栈适配mHC多残差连接与DSA长序列机制,针对细粒度MoE(64路由/Top4激活),通过专家负载均衡、Grouped GEMM、通信计算重叠及DVM图算融合,吞吐提升32%;层级与算子级选择性重计算再提升19%;自研Ascend C mHC融合算子解决Sinkhorn碎片化,计算效率提升30%,整网吞吐再提升25%。

多专家强化学习方面,基于昇腾生态完成Slime强化学习框架适配,面向Agent、Coding、Reasoning开展多专家强化学习训练,通过MOPD技术实现多专家能力高效融合,进一步提升复杂推理与智能体任务表现。

目前,昇腾已支持40余个业界头部模型完成原生训练,也是国内唯一支持商用大规模预训练,并训练落地SOTA大模型的厂商。