<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>成本 on 向叔记事簿</title>
        <link>https://ttf248.life/tags/cost/</link>
        <description>Recent content in 成本 on 向叔记事簿</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language><atom:link href="https://ttf248.life/tags/cost/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>Vera Rubin 的十倍每兆瓦 Tokens，会把 AI 价格打下来吗？</title>
        <link>https://ttf248.life/p/vera-rubin-tokens-per-megawatt-ai-price/</link>
        <pubDate>Wed, 22 Jul 2026 21:13:54 +0800</pubDate>
        
        <guid>https://ttf248.life/p/vera-rubin-tokens-per-megawatt-ai-price/</guid>
        <description>&lt;p&gt;按英伟达针对 DeepSeek-R1 推理公布的厂商基准，Vera Rubin NVL72 的每兆瓦 Tokens 指标是其 GB200 NVL72 对比项的十倍。这是机架级系统的比较，不是单颗 GPU 的结论。&lt;/p&gt;
&lt;p&gt;这个数字大得足以让人顺着算出下一句：既然同一兆瓦能做十倍的活，AI 应该很快降价。&lt;/p&gt;
&lt;p&gt;我觉得方向大体是对的，结论却下得太快。&lt;/p&gt;
&lt;p&gt;先把这十倍放回它的测试口径里。它是 NVIDIA 在 DeepSeek-R1 推理工作负载、机架级 NVL72 对机架级 NVL72 的厂商基准。它说的是，在受电力约束的场景里，一兆瓦可以交付多少 Tokens；没有说所有模型都快十倍，也没有说每一百万 Token 的完整成本已经少了九成。公开材料不足以把这项指标换算成现实服务成本：训练、长上下文、低并发、小批量、不同精度和不同服务质量目标，都可能给出另一张表。&lt;/p&gt;
&lt;p&gt;不过，这个指标仍然很重要。在受电力接入、液冷或机房交付限制的项目里，若同一份电力额度能跑出更多推理，扩容不必每次都先等变电站和机房。&lt;/p&gt;
&lt;p&gt;问题是，电费只是成本表里的一行。&lt;/p&gt;
&lt;p&gt;一套 Vera Rubin NVL72 不是把旧机架里的卡换掉就结束了。新 GPU、互连、交换网络、液冷和部署工程会一起进入资本开支。服务商还要面对折旧期、融资成本、软件迁移、故障冗余，还有利用率。机器闲着时，再漂亮的每兆瓦吞吐量也不会自动变成便宜的 Token。&lt;/p&gt;
&lt;p&gt;把服务商的单位服务成本简化为：&lt;/p&gt;
$$
\text{单位 Token 成本} \approx \frac{\text{折旧 + 电力 + 机房网络 + 运维}}{\text{实际售出的 Tokens}}
$$&lt;p&gt;这是解释变量关系的简化框架，不是依据公开材料计算出的 TCO；这里的分母是实际售出的 Tokens，不是设备理论吞吐量。每兆瓦 Tokens 的基准直接改善的是单位电力可支持的推理产能，并可能降低每 Token 的电力投入；只有需求与利用率跟上，才会通过更高的实际售出量改善单位服务成本。新系统的资本开支、折旧和部署成本也可能上升。网络、存储、排队和调度同样可能成为限制因素，系统不是单颗 GPU 在跑。&lt;/p&gt;
&lt;p&gt;先发生的未必是降价。服务商可能先把新增余量用在更长的上下文、更快的响应、更高的并发，或接住原本排队的企业需求；对开发者有价值，价目表却不必马上变化。&lt;/p&gt;
&lt;p&gt;真正的降价要等新机架从样板项目变成可复制的机房配置，利用率也被拉起来。到那时，云厂商、模型公司和推理服务商是否愿意把效率让给客户，还要看竞争。更棘手的是需求：便宜的推理若立刻诱发十倍调用量，行业得到的可能是更大的总支出和更多数据中心，而不是每个人都觉得便宜。&lt;/p&gt;
&lt;p&gt;AI 基础设施会同时制造通缩和扩张。单次生成可能更省电，用户可能得到更好的模型能力，服务商却可能因此建更多机房，因为新能力会拉出新的用法。&lt;/p&gt;
&lt;p&gt;因此，Vera Rubin 的十倍更像一张通往降价的门票，不是降价通知书。它改善了电力受限场景下的推理产能，也给服务商降价留出了空间。空间最后会被谁拿走，要看硬件定价、折旧、机房、利用率和竞争。&lt;/p&gt;
&lt;p&gt;用户最终不必执着于“API 会不会立刻便宜十倍”。更值得观察的是两个更朴素的信号：同一笔预算能否稳定买到更快、更长、更可靠的推理，以及当供给起来后，服务商会把多少效率留在利润表，多少写进价目表。前者可能先以产品能力的形式出现；后者是否出现及出现的时间，仍取决于供给、利用率和竞争。&lt;/p&gt;
&lt;h2 id=&#34;参考资料&#34;&gt;参考资料
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.nvidia.com/en-us/data-center/vera-rubin/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;NVIDIA Vera Rubin 数据中心平台&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.nvidia.com/en-us/data-center/gb200-nvl72/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;NVIDIA GB200 NVL72&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.nvidia.com/en-us/networking/products/spectrum-x/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;NVIDIA Spectrum-X 网络&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;details class=&#34;article-notes&#34;&gt;
    &lt;summary&gt;写作附记&lt;/summary&gt;
    &lt;div class=&#34;article-notes__content&#34;&gt;
        &lt;h3 id=&#34;原始提示词&#34;&gt;原始提示词
&lt;/h3&gt;&lt;blockquote&gt;
&lt;p&gt;英伟达 Vera Rubin 全面量产，Spectrum-6 网络与 NVL72 能效跃升 10 倍。DeepSeek R1 推理测试显示，Vera Rubin NVL72 每兆瓦 Tokens 吞吐量较 GB200 NVL72 提升 10 倍。大面积铺货以后，AI 是不是能降价，很明显的能效比提升了，但是硬件投入增加了很多。&lt;/p&gt;
&lt;/blockquote&gt;
    &lt;/div&gt;
&lt;/details&gt;</description>
        </item>
        
    </channel>
</rss>
