🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 科技 汽车 采集 2026-09-11T16:13:44+00:00

Arm 发布移动计算平台 CSS for Mobile 2,主打智能体 AI

原始标题:智能体时代的移动计算,Arm 通过一场大会给出自己的答案

来源
ithome
发布时间
2026-09-11T11:08:55
采集批次
2026-09-11-16
字数
2700
URL 指纹
116581b7f657a168

📌 AI 总结(348 字)

9 月 8 日 Arm 在上海举办年度旗舰活动,正式发布第二代移动终端计算子系统 CSS for Mobile 2,面向智能体 AI 与 AI 原生图形场景。该平台集成 C2-Ultra CPU 集群、Mali G2-Ultra NX GPU 与 SI L2 系统互连,其中 C2-Ultra 较前代单线程性能提升 15%、AI 模型性能最高提升 1.7 倍,语音转文本延迟降低 40%。GPU 首次嵌入神经网络加速器,支持神经超级采样、帧率提升和降噪三大技术。Arm 高管强调,CPU 在智能体时代重新定位为编排引擎而非单纯算力提供者,缓存拓扑优化是应对端侧内存瓶颈的关键。目前几乎所有旗舰手机已采用 SME2 技术,支付宝、阿里通义千问、OPPO、vivo、网易、腾讯游戏等均为生态合作伙伴。
📄 正文(2700 字)
9 月 8 日,Arm 在上海举办年度旗舰活动 Arm Everywhere China,并在会上发布了第二代移动终端计算子系统 CSS for Mobile 2。

这是一个面向智能体 AI 与 AI 原生图形的计算平台,集成了 Arm C2 CPU 集群、Mali G2-Ultra NX GPU 以及 SI L2 系统互连,同时将系统 IP、软件和开发者工具整合为完整平台。

如果只看新计算平台的命名,CSS for Mobile 2 看起来就是一次常规的更新迭代。但听完整场发布、又在采访中和 Arm 高管们聊过技术细节后,可以发现新平台每一项技术细节的升级,Arm 其实都在回答一个更根本的问题:当 AI 从问答助手进化成能理解意图、规划任务、替用户干活的智能体,手机里的计算平台该长什么样。

Arm 的判断是,移动设备的性能取决于三个核心维度——各任务阶段的执行速度、数据在不同计算引擎间的传输效率,以及系统对全任务流程的协同调度。CSS for Mobile 2 据此从系统层面统筹优化,并把优化延伸到物理实现阶段,让合作伙伴在 SoC 集成之前就能把功耗、性能和面积与架构设计放在一起考量。组件上保留了弹性,可整套采用,也可与自研或第三方 IP 组合。

Arm CSS 的思路是把底层计算技术做成集成化、经过验证、可灵活配置的计算基础,让合作伙伴不必把大量时间和工程资源耗在底层技术的整合上,而是可以站在 CSS 之上,把资源投向真正能形成差异化的地方——自己的加速器、内存架构、互连技术、系统技术和软件能力,针对目标市场和工作负载打造定制化芯片。

智能体不再只是执行推理,还要保持上下文、运行应用、协调不同模型与服务,并在用户授权下自主完成任务,而这一切都得装进手机的功耗和散热约束里。手机里的计算任务,从回答一个问题变成了独立跑完一整套流程。Arm 认为 CPU 被重新定义为系统的编排引擎,负责维护上下文、调度负载、协调任务。

新的 C2 CPU 集群由 Arm 迄今最强的移动 CPU C2-Ultra、面向能效的 C2-Pro 和双 SME2 引擎组成。全新 CPU 集群在面对最新 AI 模型性能最高提升 1.7 倍,单线程性能提升 15%,相同性能下功耗最多降低 38%。在跑 Moonshine 和 Parakeet 语音转文本模型时,C2-Ultra 比上一代 C1-Ultra 延迟降低 40%;记忆阶段的内存检索性能提升 41%,推理阶段小语言模型生成指令的平均速度提升 25%。端到端整条工作流性能提升 24%。

这一代平台把 SME2 引擎从一颗增加到两颗,矩阵算力翻倍。同时可支持 2nm 等更前沿的工艺节点,为未来留出进一步的性能空间。

Arm 边缘 AI CPU 产品管理总监 Daniel Lu 表示,过去十年行业对不同负载的侧重一直随计算需求演进,永远在为不同设备和场景寻找最合适的算力平衡点。当前旗舰 NPU 算力约 100 到 200 TOPS,搭载 SME 的 CPU 集群等效算力约 5 到 6 TOPS,计算密度极高的负载更适合交给 GPU 或 NPU,CPU 的战场是那些装得进本地算力预算的小语言模型。他特别强调 CPU 看重延迟而非峰值。

C2 CPU 集群采用差异化的拓扑架构,私有 L2 缓存加上大容量共享 L3 缓存,通过两级缓存减少访问 DRAM 的频次。Daniel Lu 坦言,端侧内存密集型的问题比计算密集型更严峻,缓存拓扑是应对这一挑战的核心手段。C2 CPU 集群最高可支持 14 个核心,合作伙伴可根据实际工作负载灵活选择。

SME2 的生态采用在加速。Arm 边缘 AI 智能终端计算副总裁 James McNiven 介绍道,目前几乎所有旗舰智能手机,无论安卓还是 iOS,都已采用 SME2 技术。阿里巴巴通义千问也在活动上展示了 Qwen-Audio 家族如何借助 Arm CPU 和 SME2 在端侧高效运行。

Mali G2-Ultra NX 是 Arm 首款 AI 原生 Mali GPU,把专用神经网络加速器直接嵌入了 GPU 着色器核心。Arm 边缘 AI 高级产品经理 Deyan Lazarov 澄清道,用的是卷积神经网络,从 GPU 渲染出的真实画面出发,用 CNN 做超分辨率和细节补全。Mali G2-Ultra NX 支持三项神经网络加速技术:神经超级采样 NSS、神经帧率提升 NFRU、神经超采样与降噪 NSSD。

在 Arm 与 Sumo Digital 基于虚幻引擎联合打造的演示游戏《光影新生》中,NFRU 与 NSSD 方案相比传统渲染实现了最高 4 倍的性能效率提升,外部内存流量降低多达 70%。Deyan Lazarov 表示,Arm 引入了不同质量等级的模型,开发者可以在画质和性能之间灵活选择。

传统图形性能方面,全新执行引擎是 Arm Mali 过去七代产品中规模最大的指令集架构升级。第三代光线追踪单元对不透明度微贴图提供硬件级支持,使用 OMM 可使帧率提升 30%,光线追踪工作负载最多降低 70%。

SI L2 系统互连是整个平台的粘合剂,支持 LPDDR6、LPDDR5X 和 LPDDR5 等多种内存标准,在缓存一致性和大模型优化方面相比上一代有明显提升。

Arm 执行副总裁兼首席商务官 Will Abbey 透露,Arm 全球合作伙伴累计出货的基于 Arm 技术的芯片已超过 3500 亿颗。CSS for Mobile 2 依托全球超过 2200 万的 Arm 开发者社区,通过 KleidiAI 与主流 AI 框架深度集成,为 Arm CPU 提供优化的软件执行路径。

产业合作方面,CSS for Mobile 2 已经获得广泛生态响应。支付宝、OPPO、vivo 已采用 SME2 技术;网易《燕云十六声》计划推出支持神经超级采样的版本,腾讯游戏《暗区突围:无限》开展神经超级采样与降噪技术演示,叠纸游戏《无限暖暖》推进神经超级采样技术集成。Arm 还在将全面设计生态项目扩展至物理 AI 领域,汇聚了 AWS、Hugging Face、Liquid AI、QNX 等 80 多家行业领先企业,首项重点聚焦于构建机器人能力分级框架。

CSS for Mobile 2 作为可灵活配置的基础平台,后续在终端芯片和整机上的落地进展仍有待观察。首批新平台旗舰机何时上市、纸面数据能兑现几分,仍要交给时间回答。