编辑 | 云昭
CUDA一直被视为英伟达GPU的最强壁垒,让许多业界的玩家望洋兴叹。
但,今天这篇文章会给各位习惯C++、CUDA开发的大佬提个醒:
有一种新的编程语言,正在AI圈兴起,撬动英伟达的围墙花园。而CUDA也不再是护城河。
近日,一位大牛 Thomas Cherickal,发表了一篇博客,阐述了一种新的编程范式。他认为,基于 MLIR 的 Mojo 无疑将取代基于 LLVM 的 CUDA,而且这种方式已经几乎可以在其他任何芯片上运行,包括谷歌TPU、AMD、英特尔以及任何定制的AI芯片!作者思路非常清晰,从市场竞争格局、硬件和软件的趋势变化两个角度,拆解了 CUDA 的优势和致命缺陷,并做出了论断:CUDA 将走向终点,而 Mojo 才是未来。篇幅较长,建议大家收藏细读。
1.CUDA:一座看得见的围墙花园
其实,即便 OpenAI、DeepMind 这些 AI 巨头,其实也都曾苦 CUDA 久矣。问题是,目前还没什么好替代品。
自 2007 年推出以来,CUDA 一直是 GPU 编程的黄金标准。它让开发者能够更精细地控制 GPU,但也让英伟达在软硬一体的算力生态中建立了坚固的护城河:
- 硬件绑定:只能运行在英伟达 GPU 上,AMD 或其他芯片基本无缘;
- 学习门槛高:使用 C++ 风格,语法复杂,不适合初学者;
- 创新被封锁:一旦你选了 CUDA,就意味着难以迁移,成本高、空间小。
从训练模型到部署推理,CUDA 的封闭性和高门槛,让无数开发者又爱又恨。一边是性能无敌的 GPU,一边是写起来像黑魔法一样的 CUDA。
过去,AI 公司要想跑得快,几乎只能选英伟达。
然而,Mojo 出现了,它带来了一种更优的方案。
2.英伟达的挑战者越来越多,需要新的编程理念
在分析 Mojo 优势之前,不妨先研究下,英伟达硬件的竞争者们。
到了2025年年中,情况在发生变化。IT界正在向异构化彻底转变。由此,我们看到科技巨头从没有放弃推出自己的芯片。
我们看到专用硬件遍地开花:
•英特尔Gaudi系列:
英特尔的Gaudi处理器专为深度学习训练和推理而设计,是英伟达GPU的有力竞争者。
•AMD Instinct MI系列:
AMD的MI系列GPU为高性能计算和AI工作负载而设计,是英伟达数据中心GPU的竞争者。
•Groq张量流处理器(TSP):
Groq的TSP架构为低延迟推理和高吞吐量而设计,尤其适用于大语言模型。
•谷歌TPU:
谷歌的TPU是针对机器学习工作负载(尤其在谷歌云基础架构中)优化的定制芯片。
•AWS Trainium:
AWS Trainium是一款为机器学习训练而设计的芯片,具有高性能和成本效益。