🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 科技 采集 2026-08-16T04:09:47+00:00

华为昇腾完成小红书dots3-note preview大模型0Day适配

原始标题:华为官宣昇腾 0 Day 适配小红书最新开源大模型 dots3-note preview

来源
ithome
发布时间
2026-08-16T03:10:19
采集批次
2026-08-16-04
字数
1066
URL 指纹
67c8924224d2fc32

📌 AI 总结(223 字)

小红书发布dots3-note preview开源大模型后,华为宣布昇腾Atlas 800 A3及Atlas 900 A3 SuperPoD超节点已完成该模型的全量适配,并基于vLLM Ascend推理引擎提供部署与推理能力。该模型以280B总参数量、16B激活参数构建,支持文本、视觉、语音全模态理解。华为通过FlashComm通信优化、FUSED_MC2通算融合及MTP投机解码等技术,降低推理时延并提升吞吐,为高并发业务提供低时延算力支撑。
📄 正文(1066 字)
IT之家8月16日消息,小红书8月14日正式发布dots3-note preview开源大模型。华为官方宣布,昇腾Atlas 800 A3、Atlas 900 A3 SuperPoD超节点已完成dots3-note preview的全量适配,并基于vLLM Ascend开源推理引擎提供完整的部署与推理能力。

据介绍,作为dots3系列的首个版本,dots3-note preview开源大模型以280B总参数量、16B激活参数量构建能力底座,同时具备文本、视觉、语音全模态感知理解能力。官方表示,该模型在推理、Agent及多模态感知等能力上进行了全面优化,在多项任务上取得了比肩国内外更大尺寸优秀模型的效果。

华为官方表示,在该模型发布当天,昇腾完成0Day推理部署适配与性能优化,在完整保留模型文本、视觉、语音一体化全模态理解能力的前提下,实现了稳定运行与生成效率提升,为长程复杂任务场景智能落地提供算力支撑。

基于vLLM Ascend推理框架,华为完成dots3-note preview文本、图片、音频全模态能力的端到端适配,打通视觉编码器、音频特征提取与LLM主干推理的全链路,完整保留模型原生多模态理解与交互能力,支持图文、音文、视频等多模态输入场景的稳定推理。

FlashComm通信优化:针对AllReduce后RMSNorm、Dynamic Quant、MLA QKV降维等列向无关算子的冗余计算问题,通过数学等价变换将AllReduce拆解为ReduceScatter+AllGather,把列向独立算子前移至两阶段通信之间执行,彻底消除多卡间的重复计算,有效降低推理时延。

FUSED_MC2通算融合:启用MoE层dispatch_ffn_combine融合算子,将原本「dispatch、gmm1、swiglu、gmm2、combine」等通信的多段独立Kernel合并为单一大算子,通过减少Kernel Launch次数、通信与计算深度流水、中间张量不落盘等手段,显著提升MoE推理吞吐。

针对增量推理阶段TPOT这一吞吐核心瓶颈,在vLLM Ascend中原生适配dots3-note preview的MTP投机解码能力,通过单次前向并行生成多Token候选并校验复用,大幅减少解码前向次数,有效降低TPOT、提升整体生成效率,更好满足高并发在线业务的低时延诉求。

华为同步公布了dots3-note preview昇腾部署指导、模型权重及小红书官方技术blog等链接,供开发者参考使用。