Token效率新标尺下,中科曙光scaleFabric以“算存传
时间:2026-09-18 22:01 来源:未知 人气:
当模型参数大到单卡放不下时,真正决定效率的,已经不只是某一块加速卡的峰值算力,而是数据在算力、网络和存储之间“搬得有多快、等得有多久”。
近期,中科曙光发布了Token加速技术体系,该体系以scaleFabric原生无损RDMA为核心网络传输底座,构建算-存-传三级紧耦合的Token加速超级通道。其中,支持GPU直通网络的IBGDA技术实现在国内的首次规模化落地。
中科曙光高速网络互联产品部总工程师万伟在媒体沟通会上表示,此次发布的scaleFabric
Token加速技术体系,以原生无损RDMA为底座,构建算-存-传三级紧耦合的Token加速超级通道,并推动支持GPU直通网络的IBGDA技术进入国内首次规模化落地阶段。
算存传三级紧耦合:scaleFabric的Token加速超级通道
现在的大模型基本都基于Transformer架构,按Token进行处理。因此,Token是当前AI Factory最重要的产出,也是衡量AI效能和经济效益的重要指标。万伟强调,算力、网络和存储三者之间的数据流转效率,是整个AI Factory的关键。
实际上,scaleFabric的核心思路,是以原生无损RDMA为底座,构建算-存-传三级紧耦合的Token加速超级通道,让Token在训练、推理、存储全流程高速流转。
在计算环节,scaleFabric原生支持GPUDirect RDMA,也就是GDR。这是一项基础能力,相当于让网卡直接读写GPU显存,绕过传统路径中由CPU内存中转的一次数据拷贝。传统通信路径中,数据需要从GPU显存拷贝到CPU内存,再由CPU通过网卡发出,接收端则是相反过程。GDR允许网卡直接读取或写入GPU显存,完全绕过主机CPU和系统内存,极大降低了通信延迟并减少了CPU开销。
但GDR并没有解决全部问题。万伟解释,即使采用GDR,虽然数据面绕过了CPU内存,但通信任务的下发和相关元数据处理仍然需要CPU参与。RDMA通信可以分为控制面和数据面,传统GDR主要优化了数据面。IBGDA则进一步把通信控制和数据处理都放到GPU上完成,使GPU Kernel能够直接驱动网卡。
具体来说,IBGDA允许GPU内核直接驱动和控制InfiniBand网卡,使GPU可以不依赖