<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>コスト on 向叔の手帳</title>
        <link>https://ttf248.life/ja/tags/%E3%82%B3%E3%82%B9%E3%83%88/</link>
        <description>Recent content in コスト on 向叔の手帳</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>ja</language>
        <lastBuildDate>Wed, 22 Jul 2026 21:08:13 +0800</lastBuildDate><atom:link href="https://ttf248.life/ja/tags/%E3%82%B3%E3%82%B9%E3%83%88/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>Vera Rubin の 10 倍 / メガワットあたりの Tokens は、AI の価格を引き下げるのか？</title>
        <link>https://ttf248.life/ja/p/vera-rubin-tokens-per-megawatt-ai-price/</link>
        <pubDate>Wed, 22 Jul 2026 21:13:54 +0800</pubDate>
        
        <guid>https://ttf248.life/ja/p/vera-rubin-tokens-per-megawatt-ai-price/</guid>
        <description>&lt;p&gt;NVIDIA が DeepSeek-R1 推論について発表したベンダーのベンチマークによれば、Vera Rubin NVL72 は 1 メガワットあたりのトークン数において、比較対象の GB200 NVL72 の 10 倍の性能を示すという。これはラック規模システムでの比較であり、単一 GPU に関する結論ではない。&lt;/p&gt;
&lt;p&gt;この数字が大きすぎて、誰もが次の文を推測したくなる。同じ1メガワットで10倍の作業ができるなら、AIはすぐに値下がりするはずだ、と。&lt;/p&gt;
&lt;p&gt;方向性としては概ね正しいと思うが、結論を急ぎすぎている。&lt;/p&gt;
&lt;p&gt;まずこの「10倍」を本来のテスト枠組みに戻そう。これは NVIDIA が、DeepSeek-R1 の推論ワークロード、ラックスケール NVL72 同士のベンダー間ベンチマークとして提示したものである。つまり電力制約のあるシナリオにおいて、1 メガワットあたりでいくつの Tokens を出せるかを示しているに過ぎず、すべてのモデルが10倍速いとか、100万トークンあたりの総コストが90%減ったとは主張していない。現実の運用コストにその指標を換算するには、公表されている資料だけでは不十分である。学習、長コンテキスト、低コンカレンシー、小さなバッチサイズ、異なる精度、異なるサービス品質目標によって、別の数字が出てくる可能性がある。&lt;/p&gt;
&lt;p&gt;ただし、この指標は依然として重要です。電力アクセス、液冷、またはデータセンター納入に制約があるプロジェクトでは、同じ電力枠でより多くの推論を実行できれば、拡張のたびに変電所やデータセンターを待つ必要はありません。&lt;/p&gt;
&lt;p&gt;問題は、電気料金が原価表の中の一行に過ぎないということです。&lt;/p&gt;
&lt;p&gt;Vera Rubin NVL72 を 1 セット導入するということは、古いラック内のカードを入れ替えるだけでは終わりではありません。新しい GPU、相互接続、スイッチネットワーク、液冷、配備エンジニアリングがすべて設備投資に組み込まれます。サービスプロバイダーはさらに、減価償却期間、資金調達コスト、ソフトウェア移行、フォールトトレランス、そして利用率にも対応しなければなりません。マシンが遊んでいる状態では、たとえ 1 メガワットあたりのスループットがいかに見栄え良く見えても、それが自動的に安価な Token にはなりません。&lt;/p&gt;
&lt;p&gt;サービスプロバイダーの単位サービスコストを以下のように簡略化します：&lt;/p&gt;
$$
\text{トークン単位コスト} \approx \frac{\text{減価償却 + 電力 + データセンター回線 + 運用保守}}{\text{実際に販売された Tokens}}
$$&lt;p&gt;これは変数間の関係を簡略化した枠組みであり、公表資料から算出した TCO ではありません。这里的分母は実際に販売された Tokens であり、設備の理論的スループットではありません。&lt;/p&gt;
&lt;p&gt;每メガワット Tokens の基準が直接的に改善するのは、単位電力で支えられる推論能力であり、Token あたりの電力投入を低下させる可能性があります。需要と稼働率が伴って初めて、実際の販売量の増加によって単位サービスコストが改善されます。&lt;/p&gt;
&lt;p&gt;新システムの設備投資、減価償却、展開コストは上昇する可能性もあります。ネットワーク、ストレージ、キューイング、スケジューリングも制約要因となり得ます。システムは単一の GPU で動作しているわけではないからです。&lt;/p&gt;
&lt;p&gt;最初に起きるのは値下げとは限らない。事業者は新しい余剰容量を、より長いコンテキスト、より速い応答、より高い同時実行性、あるいは元々キュー待ちだった企業の需要を受け止めるために使うかもしれず、開発者にとっては価値があるが、価格表はすぐには変わらない可能性がある。&lt;/p&gt;
&lt;p&gt;実際の価格低下が実現するのは、新しいラックがサンプルプロジェクトから複製可能なデータセンター構成へと移行し、利用率も引き上がったときである。その時になって初めて、クラウド事業者やモデル企業、推論サービス事業者が効率向上分を顧客に還元するかどうかは、競争状況次第となる。さらに難しいのは需要の問題である。推論の低価格化が即座に10倍の呼び出し量を誘発すれば、業界全体が得られるのは一人ひとりのコスト低下ではなく、総支出の増大とデータセンターの増加かもしれない。&lt;/p&gt;
&lt;p&gt;AIインフラはデフレと拡張の両方を同時に生み出します。1回の生成はより省電力になる可能性があり、ユーザーはより良いモデル能力を得られる可能性がありますが、サービスプロバイダーは新しい能力が新たな用途を引き出すため、より多くのデータセンターを建設する可能性があります。&lt;/p&gt;
&lt;p&gt;したがって、Vera Rubin の10倍という数値は、値下げを通知する通達というよりも、値下げへのチケットのようなものです。電力に制約のあるシナリオにおける推論能力を向上させ、サービス提供者にも値下げの余地を残します。その余地を最終的に誰が手に取るのかは、ハードウェアの価格設定、減価償却、データセンターの利用率、そして競争次第です。&lt;/p&gt;
&lt;p&gt;ユーザーは最終的に「API がすぐに10倍安くなるか」といった点にこだわらなくてよい。観察する価値があるのは、もっと素朴な2つのシグナルである。同じ予算で、より速く、より長く、より信頼性の高い推論を安定的に買えるかどうか、そして供給が増えてきたとき、サービス事業者が効率性のどれだけを損益計算書に残し、どれだけを価格表に反映するか。前者はまず製品機能の形で現れるかもしれない。後者が現れるかどうか、そして現れる時期は、依然として供給、利用率、競争次第である。&lt;/p&gt;
&lt;h2 id=&#34;参考資料&#34;&gt;参考資料
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.nvidia.com/en-us/data-center/vera-rubin/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;NVIDIA Vera Rubin データセンター プラットフォーム&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.nvidia.com/en-us/data-center/gb200-nvl72/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;NVIDIA GB200 NVL72&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.nvidia.com/en-us/networking/products/spectrum-x/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;NVIDIA Spectrum-X ネットワーキング&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;details class=&#34;article-notes&#34;&gt;
    &lt;summary&gt;写作附记&lt;/summary&gt;
    &lt;div class=&#34;article-notes__content&#34;&gt;
        &lt;h3 id=&#34;元のプロンプト&#34;&gt;元のプロンプト
&lt;/h3&gt;&lt;blockquote&gt;
&lt;p&gt;NVIDIA Vera Rubin が全面量産に入り、Spectrum-6 ネットワークと NVL72 のエネルギー効率が 10 倍に向上。DeepSeek R1 の推論テストでは、Vera Rubin NVL72 のトークン処理量がワットあたり GB200 NVL72 比で 10 倍に向上したことが示されています。大規模に出回るようになれば、AI の価格を下げられるようになるのでしょうか。エネルギー効率の明確な向上が見られる一方で、ハードウェアへの投資は大幅に増加しています。&lt;/p&gt;
&lt;/blockquote&gt;
    &lt;/div&gt;
&lt;/details&gt;</description>
        </item>
        
    </channel>
</rss>
