🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 科技 汽车 采集 2026-09-08T04:11:55+00:00

Arm发布第二代移动计算子系统CSS for Mobile 2

原始标题:Arm 发布第二代移动终端计算子系统 CSS for Mobile 2,支持双 SME2 引擎,神经加速 GPU

来源
ithome
发布时间
2026-09-08T02:28:45
采集批次
2026-09-08-04
字数
1611
URL 指纹
db473f0c0b748756

📌 AI 总结(245 字)

Arm在上海年度活动上发布第二代移动终端计算子系统CSS for Mobile 2,面向智能体AI与AI原生图形需求。该平台集成C2 CPU集群、Mali G2-Ultra NX GPU及系统互连,包含双SME2引擎,AI模型性能最高提升1.7倍,端到端整体性能提升24%。GPU首次嵌入神经网络加速器,支持神经超级采样、神经帧率提升等技术,120帧游戏中性能效率最高提升4倍。Arm Mali GPU累计出货已超140亿颗,平台同时整合软件工具与KleidiAI框架,降低开发者使用门槛。
📄 正文(1611 字)
Arm今天在上海举办年度旗舰活动Arm Everywhere China,并在会上发布了第二代移动终端计算子系统CSS for Mobile 2。这是一个面向智能体AI与AI原生图形的计算平台,集成了Arm C2 CPU集群、Mali G2-Ultra NX GPU以及SI L2系统互连,同时将系统IP、软件和开发者工具整合为完整平台。

Arm方面表示,智能体AI的能力已从早期的问答交互,演进到理解用户意图并自主执行任务的阶段,智能体工作流和日益复杂的AI原生图形技术,对移动计算提出了新的要求。移动设备的性能表现将取决于三个核心维度:各任务阶段的执行速度、数据在不同计算引擎间的传输效率,以及系统对全任务流程的协同调度能力。

CSS for Mobile 2据此从整体系统层面统筹优化性能、能效和数据传输效率,并将优化延伸至物理实现阶段,使合作伙伴在开展SoC集成之前,就能将功耗、性能和面积与架构设计协同考量。该平台在组件选用上保留了灵活性,合作伙伴既可以单独选用各个组件,也可以将其与自研IP或第三方IP结合。

CPU部分,Arm C2 CPU集群融合了C2-Ultra CPU、C2-Pro CPU以及第二代Arm可伸缩矩阵扩展(SME2)技术。该集群在最新AI模型上的性能最高提升达1.7倍,单线程性能最高提升15%,网页浏览速度提升15%,应用启动速度提升12%,集群级多线程性能提升12%。

与上一代配置相比,新一代C2 CPU集群集成双SME2引擎,SME2能力翻倍。运行最新的Moonshine和Parakeet语音转文本模型时,搭载SME2的C2-Ultra相比C1-Ultra延迟降低40%;在记忆阶段,其内存信息检索与搜索性能较上一代提升41%;在推理阶段,小语言模型结合检索到的上下文生成结构化指令的平均速度较上一代提升25%。在涵盖语音处理、记忆检索、推理、应用执行和网页浏览等环节的端到端测试中,C2-Ultra配置相比上一代实现了24%的整体性能提升。

Arm同时介绍了该工作流的核心编排层,负责维护任务状态、整合上下文信息,并决定工作流中每个阶段由哪个计算资源执行,CPU统一协调权限管理与任务执行进程。

GPU部分,Mali G2-Ultra NX是Arm首款AI原生Mali GPU,核心变化是将专用神经网络加速器直接嵌入GPU着色器核心,使神经图形工作负载能够与图形和计算任务并行运行。该GPU结合全新执行引擎和第三代光线追踪单元,为神经图形工作负载提供AI原生图形基础。

该GPU支持三项神经网络加速技术:神经超级采样(NSS)基于低分辨率渲染画面重建更高分辨率的图像;神经帧率提升(NFRU)通过生成中间帧提高帧率;神经超级采样与降噪(NSSD)将超分与降噪相结合,面向复杂光线追踪场景。

在Arm与Sumo Digital基于虚幻引擎联合打造的演示游戏中,NFRU与NSSD方案与传统渲染相比实现了最高4倍的性能效率提升,外部内存流量降低多达70%,可支持最高120帧每秒的稳定运行。

执行引擎是Arm Mali过去七代产品中规模最大的指令集架构升级,支持每个线程束的寄存器数量比上一代多达2倍。与上一代产品相比,其基准测试性能最高提升24%,非AI游戏性能提升14%。光线追踪方面,新架构在主流光线追踪基准测试中可将DRAM流量最多降低13%,并对不透明度微贴图(OMM)提供硬件级支持。Arm Mali GPU的累计出货量已超过140亿颗。

软件层面,CSS for Mobile 2依托全球超过2200万的Arm开发者社区,通过KleidiAI与主流AI框架的深度集成,为Arm CPU提供优化的软件执行路径。Arm AI Portal在统一平台汇聚经过优化和验证的模型、性能数据及部署资源,Arm MCP服务器将这些能力引入智能体AI开发环境。