本博客日IP超过2000,PV 3000 左右,急需赞助商。
极客时间所有课程通过我的二维码购买后返现24元微信红包,请加博主新的微信号:xttblog2,之前的微信号好友位已满,备注:返现
受密码保护的文章请关注“业余草”公众号,回复关键字“0”获得密码
所有面试题(java、前端、数据库、springboot等)一网打尽,请关注文末小程序
【腾讯云】1核2G5M轻量应用服务器50元首年,高性价比,助您轻松上云
9 月 17 日华为在上海举行的全联接大会不知道有多少朋友关注了,这个大会信息量还是很大的,整体来说就是对我们的 AI 发展有些利好。
在这个全联接大会,华为发布了一个名为 Peerium 计算架构的全新体系。官方口径非常大胆,该架构能让百万级处理器作为一台计算机协同工作,并称其“突破了图灵范式,提出了 Nested BSP,突破了冯·诺依曼单机架构,颠覆了长久以来的主从架构”。
消息一出,科技和媒体圈都炸了锅,难道是“我们课本里学了几十年的计算机基础理论,要被改写了吗?”
哎,这里边到底是啥情况,先别急着下结论。通过阅读本文,我们来看看华为是真的“突破冯·诺依曼架构”了吗?Peerium 的创新到底在哪里?这种架构可行吗?会成为主流吗?
什么是冯·诺依曼架构?
很多人可能并不清楚冯·诺依曼架构,我们先来大致了解一下它。
简单来说,冯·诺依曼体系结构的要点是计算机采用二进制数制,按照程序“顺序执行”,系统由运算器、控制器、存储器、输入和输出五部分组成,主从关系贯穿其中。从 ENIAC 到如今最先进的计算机,基本都沿用这一架构。
但请注意华为的措辞,是“突破了冯·诺依曼单机架构”,不是“推翻冯·诺依曼体系”,更不是抛弃了冯·诺依曼体系。
文章配图参见我的公众号:https://mp.weixin.qq.com/s/dtxI4bozFt9uMO6qqtfmWw。
这中间的差别很关键。冯·诺依曼体系描述的是单台计算机内部如何组织计算与存储;而华为做的事情,是把“一台计算机”的边界本身给抹掉了。
华为突破的究竟是什么?
假设过去你有一百块 GPU,本质上就是一百台各自为政的机器。各自带自己的内存,数据要靠网络拷贝来拷贝去,一台主机管控全部节点,这就是“主从架构”。而 Peerium 的目标是逻辑上把百万级处理器融合成“一台更大的计算机”,所有芯片共享同一个内存地址空间,地位对等,协同工作。
换句话说,华为没有推翻“单机内部”的冯·诺依曼原理,而是在“集群层面”重新定义了“单机”。如果说冯·诺依曼解决的是“一台机器内部怎么算”,Peerium 解决的就是如何让“一百万台机器如何表现得像一台机器”。这个表述是否算“突破”,见仁见智,但它确实切中了当下 AI 算力最痛的点。
对应的“突破”也好,创新也好,arXiv 上有一篇编号为 2609.16787 的论文,标题是《嵌套并行冯·诺依曼架构与嵌套式 BSP》,推荐感兴趣的可以去看看。
为什么要这么做?
华为为什么要这样做呢?因为传统的集群模式已经遇到了天花板了。
AI 大模型时代,程序顺序执行的假设与超大规模并行计算的需求之间矛盾日益尖锐。业界数据显示,十万卡规模的 AI 集群有效算力利用率目前仅约两成,互联通信正是主要瓶颈。
杨超斌在大会上也提到了同样的数字,传统架构下十万卡集群的实际模型算力利用率仅约 20%,这正是华为以“灵衢”互联为核心重构计算架构的直接动因。
打个比方,过去堆芯片,像是把一万个厨师塞进一个厨房,没有合理分工协调,只会一团糟。堆到十万卡,80% 的钱和电都浪费在了“等数据、搬数据”上。这不是芯片不够强,而是计算机的“组织方式”跟不上了。
Peerium 的三板斧
既然传统的方式有缺点,那 Peerium 是如何改进的呢?答案就是嵌套并行、统一内存寻址、平等互联。
根据发布会上的信息,Peerium 计算架构基于三大核心能力实现百万级处理器的强扩展。
- 第一,嵌套并行(Nested BSP)。这是一种将并行计算任务分层递归组织的计算范式。传统并行计算中,同步是所有节点停下来“对表”,节点越多,等得越久。Nested BSP 把任务分层组织,小范围内快同步、大范围内粗同步,用嵌套结构缓解大规模并行的同步开销。
- 第二,统一内存寻址。这被普遍认为是 Peerium 最核心的一环,把海量 NPU 和内存资源做“全局统一编址”,所有芯片共享同一个地址空间,不再各自为政、反复拷贝数据。这直接对准了困扰行业几十年的“存储墙”问题,传统架构下数据来回搬运的能耗和时间,甚至比计算本身还多。
- 第三,平等互联 + 灵衢总线。灵衢是实现 Peerium 的关键互联技术,基于开放协议,可无限扩展地联接 CPU、NPU、内存、SSD、网卡和交换机,实现计算、存储与网络的平等互联。互联是 Peerium 真正的“硬骨头”,华为早在 2025 年就披露过超节点互联的两大难题,长距离高可靠(电互联最多只能支持两柜互联,光互联可靠性不足),以及大带宽低时延(当时最好只能做到 3 微秒左右,距 Atlas 950/960 设计需求仍有约 24% 差距,而 0.1 微秒的提升都已逼近物理极限)。灵衢就是华为给出的系统性解法。
说白了,华为或 Peerium 的创新不在“芯片”上,而在“组织”上,用互联把算力、存储、网络捏成一个逻辑整体,用新的编程范式驾驭百万级并行。
是 PPT 还是真落地?
概念的成色,要看产品。和一些车企不一样的是,PPT 上的内容已经有对应的落地产品了。
Peerium 的首代产品是 Atlas 950 超节点,华为称 25.6 万卡 Atlas 950 超节点集群已经在部署中,基于 NPO 的 Atlas 960 系统正在测试中。
从一年前“万卡超节点”到今天 25.6 万卡集群部署,华为超节点的扩张速度相当激进。要知道,英伟达主流的 NVL 系统只能支持 144 卡互联,华为把这个数字提升了两个数量级。
当然,“在部署中”不等于“跑满百万卡”。实际的大规模有效算力利用率、故障率、真实训练效率,还需要更长时间检验。
百万级处理器协同,难点在哪里?
有的人点赞,有的人吐槽,但不管如何我想在兴奋之余,几个现实挑战不能回避。
- 一致性与编程复杂度。百万级节点共享统一地址空间,内存一致性如何维护?缓存如何失效?Nested BSP 作为新编程范式,意味着开发者要重新思考并行算法,配套的编译器、算子库、调度系统都要重建生态。
- 故障域问题。一百万颗处理器,按任何故障率算,任何时候都有部件在坏。“一台计算机”越像整机,单点故障的爆炸半径就越大。容错、隔离、热修复能力,是百万级规模能否成立的生命线。
- 物理极限。互联时延已逼近微秒级的物理极限,功耗与散热更是超节点的隐形天花板。架构再优雅,也绕不开电与热的物理约束。
- 开放协议的生态战。灵衢选择开放协议路线,意图成为行业标准。但互联标准历来是生态之争,英伟达有 NVLink,行业有 CXL、UALink 等阵营。Peerium 能否成为事实标准,取决于多少厂商愿意跟进。
会成为主流吗?
目前,不少技术大佬认为,在 AI 数据中心和超算领域,这种架构方向大概率会成为主流;但它不会、也不需要成为人人电脑手机里的架构。
对应的主要原因有三点,如下所示。
- 需求牵引真实存在。Agentic AI 时代算力需求爆发式增长,单纯堆芯片的边际收益已经递减,“架构换效率”是行业共同的必然选择。事实上不止华为,英伟达的超节点(NVL 系列)、AMD 及行业联盟的 UALink,都在走“把更多芯片融合成更大逻辑整机”的路。Peerium 是这条路上的激进一极。
- 中国在算力受限背景下的战略选择。单芯片制程受制约的情况下,用系统架构创新对冲单芯片差距,是中国算力产业的现实路径。Peerium + 灵衢 + 超节点,本质上是把竞争战场从“单颗芯片”转移到“系统集成”。
- 适用范围有边界。统一内存寻址、全局编址、超大规模总线,只对数据密集型、并行度极高的负载(大模型训练/推理)才划算。通用计算、消费电子、边缘设备,仍会长期沿用经典冯·诺依曼架构。
所以更准确的说法或许是,冯·诺依曼架构不会被推翻,但“一台计算机”的定义正在被改写,从一块主板,到一间机房,再到一座算力工厂。
结语
所以,华为真的突破了冯·诺依曼架构吗?
严格地说,Peerium 没有推翻二进制和顺序执行这些底层原理,它突破的是“单机”的边界、主从的层级、集群等于多台电脑简单叠加的旧范式。这是一次“系统级、互联级、编程模型级的创新”,而不是理论物理式的颠覆。
但是,即便如此,它的意义依然重大。在摩尔定律放缓、堆料边际收益递减的今天,“怎么组织算力”正在取代“怎么制造更快的芯片”,成为算力竞争的下一个主战场。华为押注 Peerium,就是押注这个判断。
百万颗芯片像一台电脑那样协同工作,这件事能否真正跑通,Atlas 950 的 25.6 万卡集群将给出第一批答案。毕竟算力再强,都在等数据,GPU 大部分时间在“空转”可不行。

最后,欢迎关注我的个人微信公众号:业余草(yyucao)!可加作者微信号:xttblog2。备注:“1”,添加博主微信拉你进微信群。备注错误不会同意好友申请。再次感谢您的关注!后续有精彩内容会第一时间发给您!原创文章投稿请发送至532009913@qq.com邮箱。商务合作也可添加作者微信进行联系!
本文原文出处:业余草: » 华为突破了冯诺依曼单机架构?扔出王炸?