Arm CSS for Mobile 2发布:C2双SME2跑小模型,Mali G2把神经超分塞进GPU管线

2026-09-09 09:13 👁️ 4 阅读

摘要

第一,9月8日上海Arm Everywhere China大会发布第二代移动计算子系统CSS for Mobile 2,C2 CPU集群配双SME2,官方口径最新小语言模型速度最高提升70%,C2-Ultra较C1-Ultra AI性能最高1.7倍、单线程最高15%、同性能功耗最高降38%。

第二,Mali G2-Ultra NX是首款内置专用神经加速器的Mali GPU,NSS超分、NFRU插帧、NSSD光追降噪三件套进图形管线;官方演示神经图形每瓦最高4倍效率,部分Neural Dawn场景外部内存流量最多降70%,传统游戏内容较上代最高提14%。

第三,同场Neoverse CSS N4与Arm AGI CPU不归移动端,前者单die最高128核、LPDDR6、PCIe Gen7,后者面向云端Agent沙箱和低延迟编排;手机SoC看CSS for Mobile 2,机架和Agent服务端看Neoverse/AGI,两条线别混。

一、C2集群:CPU从“跑模型”变“管Agent”

智能体在手机里不是只做一次推理。语音转写、记忆检索、工具调用、应用操作、网页抓取、再回到模型总结,整个流程CPU要维持上下文、派发任务、在NPU/GPU/系统内存之间做仲裁。C2集群把C2-Ultra性能核和C2-Pro能效核放在一起,两个SME2单元承担可伸缩矩阵运算,让部分小模型、语音、检索重排不一定要扔给独立NPU。

官方给的分项数据比“综合跑分”更有用:Moonshine、Parakeet等语音转文本在C2-Ultra+SME2上较C1-Ultra延迟最高降40%;记忆检索和搜索较上代最高提41%;小语言模型结合检索生成结构化指令平均提速约25%,整体端到端Agent工作流较上代快约24%。“最高70%小模型提速”是SME2翻倍后的重点宣传值,不等于所有APP都吃满;低比特权重、长上下文、系统调用频繁时,收益取决于框架是否用到SME2和KleidiAI等优化库。

指标 C1-Ultra参照 C2-Ultra / C2集群 实际意义
小语言模型速度 基线 最高+70%(双SME2) 端侧Agent草稿、摘要、分类更跟手
单线程性能 基线 最高+15% 应用启动、JS、单流推理受益
同性能功耗 基线 最高-38% 长会话、后台Agent更不易发热降频
语音转文本延迟 基线 最高-40% 唤起到首字更短
检索/搜索吞吐 基线 最高+41% 本地记忆、知识库、RAG更顺

表:C2 CPU集群相对C1代主要AI工作流改进(综合Arm新闻稿与中文发布会材料)

  1. 端侧Agent耗时分布(定性,SME2介入后)
  2. 语音/预处理 ██████ 延迟改善最明显
  3. 检索/向量过滤 ████████ 内存与SME2双受益
  4. 小模型推理 ██████████ SME2主战场
  5. 应用/系统调用 █████ 取决于OS调度,不全靠CPU峰值
  6. 说明:NPU仍做大模型解码主力,C2价值在“协调+轻模型+低延迟前处理”,不是替代NPU

二、Mali G2-Ultra NX:神经加速器进着色器管线

过去移动端做AI超分,常见办法是GPU渲染后再送NPU或独立模块处理,数据要在不同单元和内存之间来回搬。G2-Ultra NX把专用神经加速器直接放在GPU着色器核心附近,和常规光栅、计算、光线追踪共用显存和一致性缓存。它的三块能力要分开看。

NSS神经超级采样:低分辨率渲染后由神经网络重建高分辨率,例如540p输入重建1080p输出,减少全像素传统着色。特定超分场景帧率可接近翻倍,但是否“2倍FPS”取决于原生分辨率、画质模型、游戏引擎和带宽压力。

NFRU神经帧率提升:在两帧之间生成中间帧,30帧可目标插到60帧、配合其他技术支撑更高帧率;它省的是“每显示帧都全量渲染”的成本,但快速运动、遮挡变化大的场景需要额外运动矢量和质量校验。

NSSD神经超分降噪:面向光追,少打一些光线、用AI补噪声和细节,配合第三代RTU光追单元处理复杂光照。Arm与Sumo Digital用虚幻引擎做Neural Dawn/《光影新生》演示,NFRU+NSSD相对传统渲染最高4倍性能效率,外部内存流量最多降70%,并把MegaLights这类大量动态光源压到移动功耗区间。

传统图形也没躺平。新执行引擎是Mali七代来最大的ISA改动,单线程束寄存器最多翻倍、动态分配;较G1-Ultra基准最高提24%,非AI游戏最高提14%,RTUv3在光追基准里DRAM流量最多降13%,OMM不透明微贴图处理植被/毛发/透明几何的演示中帧率可提30%、光追负载最多降70%。最高120fps是持续高帧目标,不是所有游戏默认满帧。

渲染方式 计算主体 画质策略 带宽/功耗取舍
传统光栅 Shader核心 全像素着色、贴图、后处理 简单稳定,重负载下带宽吃紧
光追RTUv3 RT单元+Shader 动态光源、反射、软阴影 真实感强,但需OMM/降采样控成本
NSS/NFRU/NSSD 神经加速器+Shader 低分渲染超分、插帧、光追降噪 省渲染和DRAM,依赖模型与训练数据

表:Mali G2三种图形路径分工

  1. 移动GPU负载节省潜力(定性)
  2. 纯传统1080p高画质 █████░ 稳定但带宽高
  3. NSS超分到2K ███████░ 省全像素着色,画质看模型
  4. NFRU插帧60120 ████████ 省渲染帧,运动复杂要校验
  5. NSSD复杂光追 ██████████ 少打光、AI降噪,外部流量降幅最大
  6. 说明:神经图形不是“画质免费提升”,需要游戏接入Arm Neural Graphics SDK、提供运动矢量/深度/历史帧。

三、SI L2与整体子系统:把CPU、GPU、系统IP绑成平台

CSS for Mobile 2不是“新U+新卡”打包,真正变化在系统层。C2、Mali G2、系统MMU、系统缓存、SI L2互连、物理实现和软件工具一起交付,芯片厂拿到的不是散件而是可定制的子系统。SI L2承担CPU集群、GPU、系统IP之间的低延迟一致性访问,对Agent工作流尤其重要:小模型权重、检索结果、图形纹理、NPU中间张量如果反复跨片搬运,省下的核心算力会被总线吃掉。

对手机SoC厂商,价值是缩短旗舰定制周期;对APP开发者,价值是统一KleidiAI、Arm Neural Technology、Neural Graphics Development Kit,Unity中国团结合作、腾讯游戏MagicDawn、网易《燕云十六声》、叠纸《无限暖暖》等接入NSS/NSSD后,不需要每款游戏自己写超分模型。vivo等旗舰引入Arm神经网络技术,也说明SME2不再只是CPU特性,而是和端侧Agent框架、相册、语音、系统搜索联动。

四、Neoverse N4与AGI CPU:别和手机CSS混着看

同场发布的Neoverse CSS N4单die最高128核,支持LPDDR6、PCIe Gen7,较CSS N3最高2倍性能、1.25倍每瓦、1.75倍内存带宽,定位数据中心DPU、网络、定制AI基础设施,鸿钧微电子等国内伙伴基于N4做差异化服务器芯片。Arm AGI CPU走“量产就绪”而不是“只卖IP”,面向Agent编排、工具执行、沙箱、检索服务这类响应敏感负载;OpenAI、Meta、Oracle、Cloudflare、SAP、联想、Supermicro等围绕它做方案,火山引擎在国内把基于AGI CPU的Agent沙箱推到市场,联想展HR650a V3双路AGI服务器。

关系可以这样切:手机上CSS for Mobile 2负责端侧小模型、语音、图像、游戏超分;云端AGI/Neoverse负责多Agent调度、长上下文检索、工具服务、数据库和横向扩展。端侧省电、低延迟、隐私好;云端要的是高密度、大内存、PCIe和生态兼容。智能体产品如果只盯“Arm发了AI芯片”就全量迁移,会忽略端云任务切分。

五、落地与边界

芯片厂明年旗舰可关注C2+SME2+Mali G2的CSS配置,但是否全开NSS/NFRU要看功耗预算和游戏合作;中端机若只上部分C2-Pro和裁剪GPU,小模型70%提速不会完全复现。

开发者接神经图形别只开开关。NSS要定输入分辨率、目标分辨率、画质阈值;NFRU对竞技高帧游戏要做输入延迟测试,避免插帧增加操作模糊;NSSD需要引擎输出深度、法线、运动矢量,光追少采样后由模型降噪,画风强风格化游戏要单独微调模型。

端侧Agent别把SME2当万能。大参数模型仍走NPU或云端,C2适合做语音前端、检索重排、工具路由、结果摘要、系统调用;SME2收益前提是用支持Armv9/SME2的运行时,KleidiAI、ONNX Runtime、TFLite、PyTorch端侧路径要按目标机型实测温控。

最后一句边界:70%小模型、1.7倍AI、4倍神经图形效率、70%外部流量下降、128核Neoverse,都是“最高/特定场景”口径;实机表现看SoC配置、散热、游戏接入深度、模型量化、系统调度和厂商驱动版本。