快讯资讯
手机优化
系统数码
网络通信人工智能
网站游戏
测评专题

  重新思考 AI TCO:为何每       算力×联接,AI×未来 |    

重新思考 AI TCO:为何每 Token 成本才是唯一重要的

时间:2026-09-11 17:25 来源:未知 人气:

传统数据中心过去主要用于数据的存储、检索与处理。但在生成式 AI 与代理式 AI 时代,这些设施已演变为 AI Token 工厂。随着 AI 推理成为其核心工作负载,它们的主要产出已转变为以 Token 形式制造的智能。

这一转变也需要对包括总体拥有成本(TCO)在内的 AI 基础设施的经济效益评估的方式相应地进行调整。然而,在评估 AI 基础设施时,企业仍过于关注芯片峰值规格、计算成本,或每美元所能获得的浮点运算性能,即每美元 FLOPS。

关键区别在于:

算力成本是企业为 AI 基础设施所支付的费用,无论是从云服务提供商租用,还是在本地自建部署。

每美元 FLOPS 衡量的是企业每投入一美元所获得的原始算力,但原始算力并不等同于现实世界中的 Token 产出。

每 Token 成本指的是企业生成并交付每一个 Token 的综合成本,通常以每百万 Token 成本来表示。

前两者仅是投入指标。但当业务围绕产出运转时,只针对投入优化,本质上是一种根本性的错配。

每 Token 成本决定了企业能否实现 AI 的规模化盈利。它是唯一能够直接综合反映硬件性能、软件优化、生态系统支持以及实际利用率的 TCO 指标,而 NVIDIA 在这一指标上实现了行业最低的每 Token 成本。

能够降低每 Token 成本的因素有哪些?

要理解如何优化每 Token 成本,首先需要了解用于计算“每百万 Token 成本”的计算公式。

在这个公式中,许多评估 AI 基础设施的企业往往只关注分子项,即每 GPU 每小时成本。对于云部署而言,这对应支付给云服务提供商的小时费用;而对于本地部署,则是通过摊销自有基础设施得到的等效小时成本。然而,降低每 Token 成本的关键在于分母,即最大化实际交付的 Token 产出。

这个分母传递了两层商业含义:

最小化每 Token 成本:当 Token 产出增加被代入公式时,将降低每 Token 成本,从而提升每一次交互服务的利润空间。

最大化收入:每秒交付更多 Token,也意味着每兆瓦产出更多的 Token,这将带来更高的智能供给能力,使 AI 驱动的产品与服务能够在相同基础设施投入下创造更高收入。

因此,如果只关注分子,就会忽视真正决定分母的因素。可以将其理解为一个“推理冰山”:分子位于水面之上,直观可见且易于横向比较;而分母则隐藏在水面之下,那才是决定实际 Token 产出的关键因素。对 AI 基础设施的准确评估,应从探究水面之下的部分开始。

表层问题:

每 GPU 小时的成本是多少?

峰值 PetaFLOPS 性能和高带宽内存容量是多少?

每美元可获得多少 FLOPS?

本文标签:

更多文章

相关文章

网站导航 | 快讯 | 资讯 | 手机 | 优化 | 系统 | 数码 | 网络通信 | 人工智能

  • 游戏

    合作伙伴:

  • 友情链接(欢迎业界知名网站交换链接)申请友情

    

    声明:本站资源皆来自网络,如有侵权问题,请联系管理员处理!

    Copyright ©2020-2028快知站 版权所有 All rights reserved.

    闽ICP备20010713号-1 闽公网安备 35020602001684号