2023 年部署的英伟达 H100 芯片,如今在 Lambda 的出租价格比刚上线时还高。Lambda 是一家专门出租 AI 算力的美国云服务商,其联合创始人兼 CTO Stephen Balaban 在播客节目 The MAD Podcast 中透露了这一情况。
这个现象与很多人的预期相反。过去业界普遍认为,GPU 算力最终会像传统云计算资源一样走向标准化、商品化:硬件迭代越快,价格越低,不同供应商之间的差异越来越小。现实是,AI 算力并没有沿着这条路走。支撑 AI 应用运转的算力系统,至今没有变成像电力、带宽那样的标准商品。
芯片本身的型号和数量仍然决定一套系统有多少计算资源,但已经越来越难单独代表它能交付多少算力。Balaban 的观点指向三个原因:算力依赖系统协同、GPU 有三种时间尺度、利用率决定真实成本。
算力不是加法题,超节点难在协同
前沿 AI 任务很难由一张 GPU 独立完成。模型参数、计算任务和数据要拆分到多张 GPU 甚至多台服务器上,一次训练或推理能否顺利推进,不仅取决于单张芯片算得多快,还取决于 GPU 之间能否快速交换数据。
这让 AI 算力出现了一个与传统标准化计算资源不同的问题:同样数量、同样型号的 GPU,不一定交付同样的计算能力。网络拓扑、内存、存储以及软件组织方式的差异,都会影响最终发挥出的算力。新增一张 GPU,不等于系统获得它标称性能对应的新增产出。
超节点因此成为 AI 基础设施的重要形态。所谓超节点,不是简单堆 GPU 数量,而是通过高速互联把多颗 GPU 组织成一个紧密协同的计算单元,尽量降低 GPU 之间交换数据的成本。以英伟达 GB300 NVL72 为例:一个机架内的 72 颗 GPU 通过 NVLink 高速互联,多个机架再通过 InfiniBand 或高速以太网连接。Lambda 建设的大型 GPU 集群还会采用减少网络阻塞的架构,保证 GPU 之间有足够的通信带宽。
小型、经过压缩的模型可以放进单张 GPU,更大的模型则要跨多颗 GPU、多台服务器甚至多个机架运行。芯片本身可以标准化,但芯片如何被组织起来、最终能发挥多少性能,高度依赖整套系统。
GPU 的三套时钟:换代、折旧与经济寿命
在一个 GPU 小时的成本里,占比最大的是设备折旧。GPU、服务器和网络设备采购后要使用多年,最初的投入被分摊到后续每一个实际使用小时中。这是一门重资产生意:按 Balaban 的估算,一座千兆瓦级 AI 工厂中,发电设施需要约 20 亿至 30 亿美元,数据中心本体约 100 亿至 150 亿美元,服务器和计算设备投入可达 350 亿至 450 亿美元,其中 GPU 占最大部分。
因此,判断一张 GPU 值多少钱,不能只看它是不是最新一代,更要看它在整个使用周期里还能承担多少计算任务、产生多少收入。不少公司采用约六年的会计折旧周期,但账面折旧年限不等于设备实际能使用多久,更不等于它还能产生收入多久。只要 H100 仍能承担计算任务、又有人愿意租用,它的经济寿命就可能比市场早期预想得更长。
GPU 同时存在三套不同的时间尺度:产品迭代决定它是不是最新一代,会计折旧决定账面成本如何分摊,经济寿命决定它还能产生多久的收入。
利用率正在拉开 Token 成本差距
客户按 Token(大模型处理文本的基本单位,一次推理的计价口径)付费,但每一个 Token 背后的生产成本差别很大。GPU、服务器和网络设备不会因为没有任务就停止折旧:如果一张 GPU 只有一半时间真正用于计算,它的设备成本就只能由更少的实际使用小时来承担。Balaban 举例,在 50% 的利用率下,每个实际 GPU 小时需要承担的折旧成本相当于翻倍。
到了大型集群,问题已经不是找到一张空闲 GPU。一个万卡级 GPU 集群除了 GPU 本身,还包括负责组织任务的 CPU 服务器、存储系统,以及承担不同功能的多套网络。客户申请其中一部分算力时,供应商需要同时划分计算、存储和网络资源,并保证这些资源能够共同工作。调度和集群软件因此成为关键:它们决定一批昂贵的物理设备能否被拆分、组合,再持续交付给不同客户。没有这层软件能力,一座装满 GPU 的数据中心也很难把设备变成可随时按需调用的算力。
这也解释了为什么像 Lambda 这样的算力云(业内称 Neocloud,即新一代 AI 算力云)不能简单理解为 GPU 出租商。算力背后是一项纵向整合的服务,范围从土地、电力许可、数据中心建设,一直延伸到高性能计算设计、虚拟化和云软件。
买下 GPU 只是开始
GPU 仍然是最昂贵的设备,但决定算力价值的已经不只是 GPU 本身。AI 算力迟迟没有商品化,根源在于它从来不是一颗芯片的生意,而是整套系统的生意——协同方式、折旧节奏、利用率,共同决定算力最终卖多少钱。对采购算力的人来说,值得确认的不是一家供应商有多少 GPU,而是这些 GPU 有多少时间真正在干活;对提供算力的人来说,让昂贵设备尽量少闲置、多产出,才是这门重资产生意真正的护城河。