快讯资讯
手机优化
系统数码
网络通信人工智能
网站游戏
测评专题

  进入代理式AI时代,NVI       联想问天全球首款RISC-    

进入代理式AI时代,NVIDIA突破了“三堵墙”

时间:2026-09-10 23:14 来源:未知 人气:

过去几年,GPU算力大幅增长,而网络带宽和内存容量增长却相对缓慢。算力的指数级攀升与网络、内存的线性增长之间,横亘着一道日益扩大的鸿沟——这便是AI基础设施领域著名的通信/内存墙。代理式AIAgentic AI)时代的到来,让这道鸿沟变得更加复杂。

代理式AI时代:一场计算范式的根本性变革

前几年的大语言模型,无论是训练还是推理,都以Transformer为核心,进行大规模矩阵计算。GPU持续执行GEMM运算,而CPU更多承担数据准备、任务调度等辅助工作。因此,整个数据中心的设计目标始终围绕如何让GPU跑得更快展开。

代理式AI的出现改变了这一前提。AI Agent并不会在生成一次回答后便结束计算,而是需要不断进行思考调用工具执行代码验证结果再次推理的循环。在强化学习的后训练过程中,Agent需要持续生成代码、进入沙盒运行、获取反馈并重新优化策略。在多智能体系统中,不同Agent之间又需要频繁交换上下文、调用外部工具、共享中间状态,共同完成复杂任务。

AI的计算模式已不再是单纯的大规模并行矩阵计算,而是演变为计算、访存、网络通信与控制流高度交织的混合负载。

正是这种工作负载的根本性变化,让传统AI集群体系结构集中暴露出了三堵墙

一是控制流瓶颈——阿姆达尔定律重现。代理式AI需要频繁调用Python解释器、代码编译器、数据库、搜索引擎等外部工具。这些任务依赖大量条件判断、系统调用和控制流分支,只能由CPU串行执行。

根据阿姆达尔定律,当不可并行化部分不断增加时,即使GPU的计算能力继续提升,整个系统性能仍将受到CPU串行执行能力的限制,导致大量GPU计算资源反而会因为等待CPU而空转。NVIDIA技术博客明确指出,系统性能正日益受到代理式循环中CPU绑定串行任务的制约——这是阿姆达尔定律的典型体现。

二是通信墙与内存墙——长上下文的代价。随着模型上下文窗口扩展到数十万乃至数百万TokenTransformerKV Cache持续膨胀,占据越来越多的HBM容量。

在多节点推理过程中,这些上下文状态还需要频繁同步,引发大量网络微突发。如果是传统基于松耦合以太网的数据中心,很容易因此产生拥塞、哈希冲突和丢包,最终导致尾端延迟快速放大,

本文标签:

更多文章

相关文章

网站导航 | 快讯 | 资讯 | 手机 | 优化 | 系统 | 数码 | 网络通信 | 人工智能

  • 游戏

    合作伙伴:

  • 友情链接(欢迎业界知名网站交换链接)申请友情

    

    声明:本站资源皆来自网络,如有侵权问题,请联系管理员处理!

    Copyright ©2020-2028快知站 版权所有 All rights reserved.

    闽ICP备20010713号-1 闽公网安备 35020602001684号