2025年,人工智能的浪潮已从单纯的模型规模竞赛,迈向与千行百业深度融合的实战阶段。由此,也带来了指数级的算力增长需求。面对摩尔定律放缓、单芯片性能提升趋近物理极限,单纯依靠堆叠更多、更昂贵的GPU或CPU来获取算力,已然不切实际。
在此背景下,以CPU、GPU、NPU乃至更多样化计算单元的异构计算成为改变算力需求的主要方式。自2025年开始,异构计算就开始从多种硬件在物理机柜中的简单堆砌,转变为从芯片设计、系统架构到软件生态的全面系统进化。这样的进化,也成为应对性能、能效与供应链多重挑战的唯一途径。那么,2026年,异构计算将会有哪些技术趋势,本文将进行分析?在此之前,先让我们一起来回顾一下2025年异构计算有哪些突破。
2025年异构计算回顾:在困境中寻求系统化破局
2025年的异构计算市场,呈现出冰火两重天景象。一方面,市场需求空前高涨,大模型训练与推理、科学计算、自动驾驶等应用驱动算力需求飙升,推动全球计算迈入ZFLOPS时代。另一方面,技术生态的割裂与系统效率的低下,构成了制约产业发展的主要瓶颈。
核心的困境,主要来自于软硬件的深度割裂与内存/带宽墙。 随着国产化替代加速,市场上出现了基于不同指令集、架构的多样AI芯片。然而,每引入一种新硬件,往往意味着需要一套独立的软件栈、驱动和优化工具。这种生态壁垒使得算力资源碎片化,跨芯片的协同调度与通信异常复杂,严重拖累了整体效率。
即便在同一集群内部,数据在计算单元与存储单元间的搬运速度(内存墙),以及芯片间、服务器间海量数据交换的带宽与延迟(带宽墙),已成为比芯片峰值算力更棘手的性能瓶颈。
面对困境,通过软件和调度层的创新,对硬件进行系统级的协同创新,已得到产业界的认可。
例如,以华为昇腾CANN为代表的软件平台,正扮演着硬件统一语言的角色。CANN通过深度开放策略,将底层不同硬件的差异对上层应用屏蔽。其打造的毕昇编译器允许开发者用Python语法编写高性能算子,无需关心底层是何种NPU,使得应用创新得以与硬件快速迭代解耦,为软硬件协同优化奠定了基础。
再例如,商汤科技与上海人工智能实验室基于DeepLink体系发布的异构混合调度方案,能够在包含十余种国产芯片的集群中,实现长达20天、千亿参数大模型的稳定训练,效率可达单一芯片集群的90%。这证明了通过软件调度,异构算力完全可以被整合为高效、统一的计算资源池。


闽公网安备 35020602001684号