文章列表
AI 写作

Vera Rubin 的十倍每兆瓦 Tokens,会把 AI 价格打下来吗?

能效改善会传导为降价,但不会自动传导

按英伟达针对 DeepSeek-R1 推理公布的厂商基准,Vera Rubin NVL72 的每兆瓦 Tokens 指标是其 GB200 NVL72 对比项的十倍。这是机架级系统的比较,不是单颗 GPU 的结论。

本文目录

这个数字大得足以让人顺着算出下一句:既然同一兆瓦能做十倍的活,AI 应该很快降价。

我觉得方向大体是对的,结论却下得太快。

先把这十倍放回它的测试口径里。它是 NVIDIA 在 DeepSeek-R1 推理工作负载、机架级 NVL72 对机架级 NVL72 的厂商基准。它说的是,在受电力约束的场景里,一兆瓦可以交付多少 Tokens;没有说所有模型都快十倍,也没有说每一百万 Token 的完整成本已经少了九成。公开材料不足以把这项指标换算成现实服务成本:训练、长上下文、低并发、小批量、不同精度和不同服务质量目标,都可能给出另一张表。

不过,这个指标仍然很重要。在受电力接入、液冷或机房交付限制的项目里,若同一份电力额度能跑出更多推理,扩容不必每次都先等变电站和机房。

问题是,电费只是成本表里的一行。

一套 Vera Rubin NVL72 不是把旧机架里的卡换掉就结束了。新 GPU、互连、交换网络、液冷和部署工程会一起进入资本开支。服务商还要面对折旧期、融资成本、软件迁移、故障冗余,还有利用率。机器闲着时,再漂亮的每兆瓦吞吐量也不会自动变成便宜的 Token。

把服务商的单位服务成本简化为:

$$ \text{单位 Token 成本} \approx \frac{\text{折旧 + 电力 + 机房网络 + 运维}}{\text{实际售出的 Tokens}} $$

这是解释变量关系的简化框架,不是依据公开材料计算出的 TCO;这里的分母是实际售出的 Tokens,不是设备理论吞吐量。每兆瓦 Tokens 的基准直接改善的是单位电力可支持的推理产能,并可能降低每 Token 的电力投入;只有需求与利用率跟上,才会通过更高的实际售出量改善单位服务成本。新系统的资本开支、折旧和部署成本也可能上升。网络、存储、排队和调度同样可能成为限制因素,系统不是单颗 GPU 在跑。

先发生的未必是降价。服务商可能先把新增余量用在更长的上下文、更快的响应、更高的并发,或接住原本排队的企业需求;对开发者有价值,价目表却不必马上变化。

真正的降价要等新机架从样板项目变成可复制的机房配置,利用率也被拉起来。到那时,云厂商、模型公司和推理服务商是否愿意把效率让给客户,还要看竞争。更棘手的是需求:便宜的推理若立刻诱发十倍调用量,行业得到的可能是更大的总支出和更多数据中心,而不是每个人都觉得便宜。

AI 基础设施会同时制造通缩和扩张。单次生成可能更省电,用户可能得到更好的模型能力,服务商却可能因此建更多机房,因为新能力会拉出新的用法。

因此,Vera Rubin 的十倍更像一张通往降价的门票,不是降价通知书。它改善了电力受限场景下的推理产能,也给服务商降价留出了空间。空间最后会被谁拿走,要看硬件定价、折旧、机房、利用率和竞争。

用户最终不必执着于“API 会不会立刻便宜十倍”。更值得观察的是两个更朴素的信号:同一笔预算能否稳定买到更快、更长、更可靠的推理,以及当供给起来后,服务商会把多少效率留在利润表,多少写进价目表。前者可能先以产品能力的形式出现;后者是否出现及出现的时间,仍取决于供给、利用率和竞争。

参考资料

写作附记

原始提示词

英伟达 Vera Rubin 全面量产,Spectrum-6 网络与 NVL72 能效跃升 10 倍。DeepSeek R1 推理测试显示,Vera Rubin NVL72 每兆瓦 Tokens 吞吐量较 GB200 NVL72 提升 10 倍。大面积铺货以后,AI 是不是能降价,很明显的能效比提升了,但是硬件投入增加了很多。

文章阅读工具
作者 tianlong.xiang 写作 v8.2.0 License Licensed under CC BY-NC-SA 4.0 最后更新于

评论区将在滚动到此处后加载。