2026年9月17日,华为全联接大会2026在上海开幕,会上正式发布面向AI时代的Peerium计算架构,相关话题“华为突破冯诺依曼单机架构”迅速登上科技领域热搜,引发行业对计算架构革新的广泛讨论。
作为现代计算机沿用数十年的基础框架,冯·诺依曼架构奠定了数字计算的发展逻辑,而随着AI大模型向十万亿级参数规模演进,传统单机架构与集群堆叠模式的算力瓶颈日益凸显。华为此次发布的Peerium架构,从系统底层重构了计算资源的组织方式,为超大规模算力协同提供了新的技术路径。

Peerium架构:突破冯·诺依曼单机的底层逻辑革新
传统冯·诺依曼架构采用运算器、控制器、存储器、输入输出系统的主从分层设计,程序指令按顺序执行,单台计算机拥有独立的地址空间与运算边界。当算力需求扩展至集群规模时,多台独立设备通过网络互联,跨节点内存访问延迟高、通信开销大,集群规模越大,性能损耗越显著,难以支撑超大规模AI模型的训练与推理需求。
根据华为官方发布的技术信息,Peerium计算架构以嵌套并行、统一内存寻址、全节点平等互联为核心设计,突破了传统冯·诺依曼的单机架构边界,可将百万级独立处理器整合为一台性能统一调度的超级计算机,而非多台设备的简单堆叠。

在编程范式层面,该架构创新性提出Nested BSP(嵌套批量同步并行)编程模型,通过分层递归的方式组织并行计算任务,适配超大规模算力的协同调度需求,实现了对传统图灵执行范式的延伸。
需要明确的是,这一创新属于系统级架构革新,单颗处理器芯片内部仍遵循冯·诺依曼体系逻辑,其核心价值在于打破了单机的算力边界,让跨芯片、跨节点、跨机架的计算资源像一台完整的计算机一样统一寻址、协同运行,从根源上降低了大规模集群的通信损耗。
灵衢总线与超节点:架构落地的技术底座与产品矩阵
Peerium架构的落地,核心支撑是华为自研的灵衢(UnifiedBus)高速互联总线。作为基于开放协议打造的高速互联标准,灵衢总线可无限扩展接入CPU、NPU、内存、SSD、网卡、交换机等各类硬件,实现计算、存储与网络资源的平等互联,从硬件层保障百万级节点的高效协同。
根据华为公布的官方技术参数,灵衢互联协议将传统十余种互联协议统一为单一标准,互联带宽从百GB级提升至TB级,单板内单跳通信时延可低至200纳秒,跨柜往返时延压缩至3微秒;跨柜互联设备支持单端口1.6Tbit/s带宽,单机可实现280Tbit/s全光互联,UBG灵衢网络交换机具备1024的超大扇出能力,可支撑百万卡规模的超节点集群。在工程落地层面,单柜4096卡的超节点可通过灵衢互联刀片减少196公里铜缆布线,实现零电路损耗,同时降低布线与运维成本。
产品落地方面,Atlas 950超节点是Peerium架构的首代落地产品,基于昇腾950DT NPU打造,采用灵衢2.0全光互联协议,单集群最大可扩展至8192卡,FP8算力可达8 EFLOPS、FP4算力可达16 EFLOPS,互联带宽达16PB/s。
目前25.6万卡规模的Atlas 950超节点集群已启动部署,客户覆盖互联网、运营商、金融、政务、制造等多个行业。同期发布的Atlas 960(昇腾960)超节点,是全球首个搭载NPO近封装光引擎Hi-ONE的超节点产品,采用正交架构与全液冷设计,基于灵衢协议实现内存统一编址,单集群可扩展至4096卡,FP8算力8 EFLOPS、FP4算力16 EFLOPS。
该产品用5500个Hi-ONE光引擎替代传统方案所需的4.8万颗800G光模块,系统功耗降低超550千瓦,无故障运行时间提升一倍,系统可用度达99.8%,目前处于测试阶段,未来将主要支撑十万亿级参数大模型的训练与前沿AI场景的算力需求。
架构革新的产业价值:重构AI时代的算力底座
当前AI产业正处于模型规模快速扩张、Agentic AI等新场景爆发的阶段,算力需求呈现指数级增长,传统算力集群的“堆叠式”扩展模式面临通信墙、内存墙、功耗墙等多重瓶颈。Peerium架构与超节点产品的推出,本质上是从计算架构底层提升算力利用效率,为国内AI产业发展提供更坚实的算力底座支撑。
从应用场景的实际收益来看,统一内存寻址与低时延互联特性,能够大幅提升大模型训练中的数据交互效率,降低跨节点调度的性能损耗。在AI推理场景,依托灵衢大带宽构建的超大KVCache缓存池,可将KVCache命中率提升至99%,1M序列长度下NPU吞吐量最高提升2.6倍。在Agent沙箱场景,可实现10万沙箱10秒极速启动,部署密度提升25%,能够很好地适配智能体时代的批量算力调度需求。
在产业生态层面,华为已开放灵衢协议的技术规范,覆盖超节点参考架构、基础硬件标准、开源操作系统组件等内容,产业伙伴可基于规范自研相关产品与组件,共同推动超节点技术的规模化落地。
截至目前,华为昇腾系列超节点已服务370多家企业客户,昇腾910C超节点部署超1000套,是国内唯一支撑SOTA模型训练的国产算力平台。
写在最后
华为Peerium计算架构的发布,不是对冯·诺依曼体系的颠覆与否定,而是在AI算力需求爆发的产业背景下,对计算架构边界的系统性延伸与突破。从单机运算到百万级处理器协同,从主从分层架构到全节点平等互联,这一创新延续了中国算力产业从跟跑到逐步实现底层突破的技术脉络。
随着超节点产品的规模部署与生态开放,这套新的计算架构有望为智算基础设施带来范式级的变化,为AI技术的长期演进提供可持续、高性价比的算力支撑。


京公网安备 11010202008829号