芯片终于不再是唯一的悬念。
一年前,华为轮值董事长徐直军公布昇腾芯片路线图时,人们首先想知道,华为能不能做出来AI芯片,什么时候能供货。从950到960、970,未来数年的产品排在一起,对于一家经历过供应链断裂的公司而言,这张路线图本身就是一种信心。
但这些问题太迫切,以至于同场公布的另一项技术,没有得到同样的关注。“去年我讲了互联协议,但大家都关注芯片去了,没人关注灵衢,但灵衢是关键。”徐直军说。
一年过去,AI芯片的路线图开始变成产品,昇腾950已经上市,Atlas 950超节点开始交付,基于它构建的25.6万卡集群正在部署,下一代Atlas 960系统也进入测试阶段。产能依然紧张,但随着研发与产品迭代持续推进,外界对华为的期待也在变化。
能不能做出下一颗芯片,仍然重要。只是到了今天,这个问题已经不足以解释华为在AI算力上的全部布局。
有了AI芯片,然后呢?
2026年全联接大会期间,徐直军与华为半导体首席科学家廖恒,试图把讨论推进到下一个层级:当芯片从几颗增加到数千、数万乃至更多,怎样让它们像一台计算机一样工作?
芯片的数量容易看见,芯片之间的等待却不容易看见。大模型训练需要大量处理器频繁交换数据、同步结果,一颗芯片算得再快,也要等其他芯片完成工作。一条链路短暂异常,还可能影响一个运行了很久的任务,买到了多少峰值算力,与最终能用上多少有效算力,中间隔着整个系统。
本次大会上,华为发布了Peerium计算架构,按照华为的定义,它通过嵌套并行、统一内存寻址和平等互联,可支撑百万级处理器像一台计算机一样协作。灵衢(UnifiedBus:UB)是实现这套架构的关键互联技术,全球首个采用NPO技术的超节点——昇腾960超节点正式发布。
没有人比华为更懂连接,比如通信产业的有线、无线技术,华为的发展史就是一部不断连接一切的过程,到了AI时代,连接和计算又默契地走到一起。去年,徐直军用芯片路线图回答了外界对华为未来的追问;今年,他想解释,为什么那些芯片之间的连接,同样值得被看见。
灵衢的故事,就藏在这些连接里。
AI时代计算机也要换一种设计方式
过去一年,超节点成为AI产业的热门词汇。但在徐直军看来,同一个概念下面,产品之间存在很大区别。
“‘超节点’这个词,人人都在讲我做了超节点,但是不同厂家做的超节点是有很大的区别。”
区别首先在于,越来越多的处理器连接起来以后,能不能高效地协同工作。大模型训练需要把任务分给大量处理器,每颗芯片完成自己的计算,还要和其他芯片交换结果,再进入下一阶段。数据没有到位,计算就无法继续,一个短板会制约整个系统。