|
“智能在这里被创造。” 9月8日,在Arm Everywhere China大会现场,ARM讲述了一个从个人设备、数据中心,再连接进入现实环境的汽车与机器人的“业务全景图”。其中,个人设备承载本地智能体验,数据中心负责创建并运行大规模智能,汽车和机器人则将智能转化为现实世界中的行动。 按Arm的业务逻辑,云端、边缘与物理AI并非三组相互割裂的产品,而是对应智能在不同位置运行、协同和执行所需的计算基础。 Arm执行副总裁兼首席商务官Will Abbey透露,全球合作伙伴累计出货的Arm架构芯片已超过3500亿颗,基于Arm平台进行开发的软件开发者超过2200万名。 在既有移动设备和云基础设施业务之上,Arm正试图把这一技术覆盖进一步延伸至Agent AI与物理AI。 01云端AI:智能体增加CPU负载,Arm提供三种产品入口Agent AI正在改变数据中心的工作负载。 在此前的沟通会上,Arm首席营销官Ami Badani从生成式AI讲到Agent AI,重点解释了两者在工作负载上的差异: 生成式AI主要由提示词驱动:用户输入问题,模型完成运算,再输出文本、图片或代码。到了Agent AI阶段,AI不仅要调用模型,还要检索信息、访问数据库、使用工具、调度其他Agent,并连续执行多个任务。 她表示,大量计算“不再局限于简单地运行模型,而是发生在围绕模型运行的各个环节”。 对Arm而言,这意味着数据中心CPU面临新的增量需求,而Neoverse过去几年的部署,则构成了Arm承接这部分需求的基础。 大会现场,Arm分享出一组数据:Neoverse核心累计出货超过15亿颗,其中约5亿颗来自于近九个月。从2019年推出Neoverse到累计出货10亿颗,Arm用了约六年;从10亿颗增至15亿颗则不到一年。 现场还展示了AWS Graviton、Google Axion、阿里云倚天710、微软Cobalt、富士通Monaka和NVIDIA Vera等平台。这些产品采用的具体方案并不相同,但都建立在Arm技术之上。 基于客户不同的需求,Arm也给出了三种产品选择:IP、计算子系统CSS和完整芯片。三者使用同一套Neoverse技术和软件生态,但集成程度不同。 第一种是传统IP授权。客户采用Neoverse CPU IP,自行完成芯片设计。这种方式的自主空间较大,但客户也需要承担更多集成、优化和验证工作。 第二种是CSS。它面向仍然需要定制芯片、但希望减少通用工程投入的客户。此次发布的Neoverse CSS N4预先整合CPU、互连和内存等组件,并完成部分性能、功耗和软件验证。客户仍可加入自己的电源管理、安全、存储、网络和加速模块。CSS N4单颗裸片最高可配置128个核心,支持LPDDR6内存和PCIe 7.0互连。 Arm称,与上一代CSS N3相比,CSS N4的性能最高达到两倍,每瓦性能最高达到1.25倍,内存带宽最高达到1.75倍。这些参数主要对应Agent AI带来的并发计算、数据传输和加速器协同需求。 Arm云AI业务拓展副总裁Eddie Ramirez以微软Cobalt CPU为例,介绍了CSS的使用方式。他表示:“Azure团队利用Neoverse CSS的N系列和V系列产品,推出了两代Cobalt CPU。”微软希望建立一套能够以约18个月为周期、持续推出新一代CPU的平台,同时满足大型云客户的需求,并保留自身的差异化技术。 Eddie Ramirez介绍,微软在CSS提供的计算基础上,加入了自己的电源管理、安全,以及面向存储、加密等常见数据中心工作负载的加速能力。他表示,这套方案提高了数据中心的资源利用率和服务部署速度,并通过能效改善降低总体拥有成本。 第三种选择是Arm AGI CPU。它不是供客户二次集成的IP或计算子系统,而是一款可以直接部署的完整CPU。该产品已于2026年3月发布,此次大会主要更新其生态合作和中国市场进展。 Ami Badani以SAP为例解释了Arm进入完整芯片市场的原因。SAP的部分公有云业务已经运行在基于Arm架构的AWS Graviton服务器上,但本地私有云仍部署了大量其他架构芯片。 Arm希望通过AGI CPU,把Arm计算从云厂商的自研平台进一步带到企业数据中心和本地部署环境。 Arm还沿用了3月发布AGI CPU时公布的一组测算:与其选取的x86系统相比,AGI CPU的单机架性能超过两倍;按照1吉瓦规模的AI数据中心计算,资本开支最高可减少100亿美元。由于此次大会没有完整展示对比平台、测试环境和成本模型,这组数据仍属于Arm的测试和估算口径。 由此,Arm在云端提供了三种选择:客户可以基于IP自行设计芯片,也可以利用CSS缩短集成和验证周期,还可以直接部署AGI CPU。这扩大了Arm在数据中心市场的参与范围,也带来了新的业务边界问题:当Arm开始提供完整芯片,是否会与原有IP和CSS客户产生竞争? Arm表示,AGI CPU是对市场范围的扩展,而不是对现有客户的替代。最终,这一判断仍需通过后续的客户采用和实际部署情况验证。 02边缘AI:智能体走向本地,CPU与GPU同时调整在Arm的划分中,云端是智能诞生的地方,边缘则让智能更贴近用户。这里的边缘不仅包括手机和PC,也包括可穿戴设备、家庭设备和工业终端。 大会现场,Arm 执行副总裁兼首席商务官Chris Bergey用四组变化描述AI的发展方向:从响应提示词到主动预判和行动,从偶发交互到持续协助,从通用回答到更加个性化的体验,以及从云端优先到更多AI在本地运行。 Agent向边缘迁移,一方面受到响应延迟、数据隐私和Token成本的推动,另一方面也给终端计算提出了新的要求——Agent不仅要运行模型,还要保持上下文、调用应用,并协调不同模型和系统服务。 这些任务需要在手机有限的功耗、散热和内存条件下完成,无法只依赖某一种计算单元。针对这一变化,Arm推出第二代移动计算子系统CSS for Mobile 2。 它不是一颗单独的CPU或GPU,而是一套面向移动芯片的计算平台,整合了C2 CPU集群、Mali G2-Ultra NX GPU、增强型系统IP、物理实现方案和配套软件。 其中,C2 CPU集群负责通用计算、应用运行和Agent工作流调度;Mali G2-Ultra NX负责传统图形、神经图形及适合GPU处理的AI任务;系统IP连接不同计算单元和系统资源;软件工具则帮助开发者调用这些硬件能力。 C2 CPU集群由C2-Ultra、C2-Pro和双SME2单元组成。C2-Ultra承担高性能任务,C2-Pro侧重能效,SME2则用于加速适配的矩阵计算和AI模型。 Chris Bergey以“预订周年纪念晚餐”为例说明CPU的作用。设备需要依次完成感知、记忆、推理和行动:先理解用户要求和已有信息,再判断餐厅偏好,最后调用相关应用完成预订。 从链路来看,这种逻辑跳出了单独的模型推理,变成了由多个应用和任务组成的工作流,不仅需要单线程响应速度,也需要多线程处理能力。 Arm称,与上一代C1-Ultra相比,C2-Ultra的AI性能最高达到1.7倍,单线程性能最高提升15%,在相同性能下功耗最高降低38%。现场PPT还显示,其网页浏览性能提升15%,应用启动速度提升12%,多线程性能提升12%。 在上述Agent工作流中,C2-Ultra相比上一代方案将整体用时缩短约280毫秒,速度提升15%;加入SME2后,整体用时缩短约450毫秒,速度提升24%。这里的280毫秒和450毫秒是相对上一代节省的时间,并非任务的总耗时。C2 CPU集群配置的双SME2单元还使相关计算能力翻倍,Arm称可让最新小语言模型的运行速度最高提升70%。 CSS for Mobile 2采用的GPU是Mali G2-Ultra NX。它是首款集成专用神经网络加速器的Mali GPU,可以让神经网络计算与传统图形处理在同一处理管线中协同运行。 基于这一架构,Mali G2-Ultra NX支持三项神经图形技术:NSS利用AI将较低分辨率画面提升至更高分辨率,现场展示的示例为从540p提升至1080p;NFRU用于提升帧率,Arm称可实现帧率翻倍;NSSD则将NSS与光线重建相结合,用于超级采样和降噪。此外,该GPU还引入了新的执行引擎和第三代光线追踪单元。 Arm称,Mali G2-Ultra NX在神经网络处理场景下的每瓦性能最高提升4倍;与上一代产品相比,其在现有游戏中的性能最高提升14%。现场PPT还给出了AI原生图形帧率最高提升4倍、传统渲染基准提升24%等数据。 新硬件还需要游戏引擎和具体内容完成适配。腾讯游戏正在把Arm神经图形技术集成到MagicDawn中台,并与《暗区突围:无限》开展NSSD技术演示;Unity中国已将相关技术集成到团结引擎。 由此,Arm形成了一条从CSS平台、CPU与GPU,到软件工具、游戏引擎和具体内容的落地路径。不过,目前各项目仍处于技术演示、引擎集成或计划上线等不同阶段,实际效果还要等待芯片采用、终端量产和真实设备测试。 03物理AI:从中央算力扩展到完整机器系统如果说云端负责创建智能、边缘设备负责提供本地体验,物理AI要解决的就是如何让汽车和机器人感知环境、作出判断并完成动作。 大会现场,Arm用一辆L4自动驾驶汽车和一个人形机器人说明两类系统的共同点。它们都不是依靠一颗中央处理器完成所有任务,而是由多个计算单元协同运行:中央计算负责模型和决策,感知计算处理摄像头及其他传感器数据,交互计算负责人机沟通,分布在车身或机器人关节附近的控制器则负责执行动作。 “这不只是关于大脑,而是关于整个系统。”Arm物理AI业务拓展副总裁Dermot O'Driscoll表示,从传感器接收到信号,到执行器真正产生动作,端到端时延决定了机器能否及时响应;与此同时,系统还必须满足功耗、可靠性、确定性和安全性要求。物理AI因此不仅是模型或单点算力问题,还需要把模型、软件、芯片、传感器和执行器组合成可部署的完整系统。 Arm估算,2025年物理AI计算的潜在市场规模约为250亿美元,当年约有20亿台Arm架构设备进入相关市场;到2030年代,这一计算市场可能扩大至每年约2000亿美元。这些数字均为Arm自身估算,不能等同于已经实现的市场收入。 与云端和边缘部分直接发布CPU、GPU或CSS产品不同,Arm此次在物理AI领域的重点是组织生态。公司宣布把此前应用于云计算市场的Total Design合作模式扩展至物理AI。目前,Total Design for Physical AI已有80多家合作伙伴,覆盖芯片、操作系统、AI模型、云服务、传感器、汽车、机器人、仿真和安全验证等环节。 Arm将生态分为芯片、云端智能、执行器与传感器、执行计算、感知与交互智能以及终端解决方案等层次,安全、安保和验证能力贯穿整个体系。Arm希望合作伙伴在芯片完成前,就能借助虚拟平台和数字孪生开展软件开发、测试与验证,减少后期集成风险。 这种模式已在汽车领域展开。Arm与AWS、Google、HERE、RemotiveLabs和西门子等企业共同开发数字座舱参考方案,使开发者可以提前围绕Arm Zena CSS进行软件开发和验证。Arm希望把类似方法进一步用于机器人。 机器人行业的另一个问题,是不同企业缺少统一的能力定义。为此,Arm提出机器人能力分级框架,以RL0至RL5描述机器人从基本反应到更高自主能力的发展阶段,并将行为表现与时延、算力位置、内存、功耗、确定性和安全性等要求对应起来。 Arm首席架构师Richard Grisenthwaite在相关宣言中指出,机器人行业仍缺少一套描述、评估和交流机器能力的通用语言。现场演讲者也强调,Arm此次“带来的不是解决方案,而是一个问题陈述”。换言之,这是一项邀请产业共同完善的框架,而不是已经确立的行业标准。 因此,Arm在物理AI领域现阶段提供的不是一款统一机器人芯片,而是底层架构、开发验证环境和产业协作框架。其实际作用仍取决于合作伙伴能否形成可复用的方案,以及机器人能力分级能否获得更广泛的行业采用。
|