あなたのAPI請求額は、あなたの成功と完全に歩調を合わせて増えていく。新規顧客が増えるたびにトークンが増え、トークンが増えるたびにコストが増え、その全額が毎月欠かさず売上原価に計上される。ある規模に達すると、その従量課金の請求額は一つのラインを越える。つまり、GPUを直接購入して自分で推論を動かす方が、他人のものを借りるよりも安くなるのだ。問題は、そのラインがあなたにとってどこにあるかだ。なぜなら、それを越えることは単なるエンジニアリング上の決定ではないからだ。それはあなたの貸借対照表、粗利益率、そして確定申告書を書き換える。
本ガイドでは、損益分岐の計算、vLLMサービングスタックがなぜそのラインを動かしたのか、そしてAPI呼び出しを費用計上するのをやめてGPUクラスターを資産計上し始める日に帳簿上で何が変わるのかを解説する。
推論の支払い方には2通りある
あなたの製品が提供するすべてのトークンは、2つの方法のいずれかで支払われる。そしてそれらは財務諸表にまったく異なる形で影響する。
APIの道は純粋な営業費用である。 あなたは100万トークンあたりで支払い、請求額は使用量に応じてスケールし、全額が期間費用となる。推論は顧客への製品提供に直接結びついているため、最も自然には売上原価として計上される。初期費用ゼロ、資産ゼロ、減価償却ゼロ。どれだけ成長しても、あなたの粗利益率は毎月一定の割合で打撃を受ける。
自社ホスティングの道は主に資本的支出である。 GPUサーバーを購入し(または長期予約契約を結び)、貸借対照表に固定資産を計上し、その耐用年数にわたって減価償却する。そうすると毎月の損益計算書には、トークンあたりの請求額の代わりに、減価償却費に加えて運営コスト——電力、コロケーションまたはラックスペース、監視、そしてクラスターを健全に保つエンジニアリング工数——が表示される。
この構造的な違いがすべてだ。APIコストは永遠に使用量に比例して線形にスケールする。自社ホスティングのコストは先行投資的で、ほとんどが固定費であるため、稼働率が上がるにつれて実効トークンあたりコストは下がる。どこかでこの2つの曲線が交差する。以下はすべて、それがどこにあるかを見つけることに関するものだ。
損益分岐の計算
50以上の本番導入を分析した、広く引用される2026年の記事は、経験則を月約2万ドルのAPI支出とした。それを下回ると、自社クラスターを運用するエンジニアリングおよび運営コストは、ほぼ常に節約額を上回る。月5万ドルを超えると、トラフィックの大部分を自社ホスティングする方が通常50〜70パーセント勝つ。その2つのラインの間にはグレーゾーンがあり、詳細——あなたのモデル、あなたのトラフィック形状、あなたのチームのGPU経験——が決定を下す。
同じ分析は、それらの数字の背後にある投資の概要も示した。モデルサイズに応じてGPUハードウェアに5万〜50万ドルの初期費用、加えて月3,000〜15,000ドルの継続運営費である。これは、700億パラメータモデルを提供する中古のA100クラスの1台のマシンから、マルチノードのH100クラスターまでに及ぶ。
どのAPIを置き換えるかが極めて重要である
損益分岐の量は、現在トークンあたりいくら支払っているかによって約100倍変動する:
| 月間量 | フロンティアAPIコスト(概算) | 自社ホスティングコスト(自社ハードウェア) | 月間節約額 |
|---|---|---|---|
| 1億トークン | $1,750 | $5,500 | -$3,750(損失) |
| 5億トークン | $8,750 | $7,500 | $1,250(20ヶ月で回収) |
| 10億トークン | $17,500 | $10,000 | $7,500(7ヶ月で回収) |
| 50億トークン | $87,500 | $25,000 | $62,500(1ヶ月で回収) |
1億トークンあたり約$1,750を請求するプレミアムなフロンティアAPIに対しては、交差点は月あたり5億から10億トークンあたりに位置し、そこから回収は急速に加速する。
しかし、1億トークンあたり約$80を請求する低予算APIを置き換える場合、計算は逆転する。損益分岐には月500億トークン以上が必要となり、その量は本格的なマルチGPUクラスターと専任のインフラチームを要求する。安価なAPIがあなたの品質基準を満たすなら、小規模事業が到達するどの量でも自社ホスティングが財務的に意味を持つことはほとんどない。
稼働率がすべてである
他のコスト内訳では損益分岐はずっと低くなる——ある詳細な構築vs賃借モデルでは月約$4,200のAPI支出あたりとする——そして見積もり間の差そのものが教訓である:普遍的な損益分岐点は存在しない。 計算全体は稼働率にかかっている。24時間安定したトラフィックを処理するGPUは、その固定費を何十億ものトークンに分散させる。同じGPUが日中の断続的なトラフィックのみを処理する場合、一晩中アイドル状態で、何の成果もなく減価償却され、そのアイドル時間は真のトークンあたりコストを静かに2倍または3倍にする。
この記事の数字を含め、誰かの損益分岐の数字を信頼する前に、自分のトラフィック形状を測定せよ:持続的な毎秒トークン数、ピーク対平均比、成長勾配。平坦で予測可能で成長する量は自社ホスティングに有利である。断続的または少量の場合は、アイドルコストがゼロであるAPIに有利である。
vLLMがラインを動かした理由
選ぶサービングスタックは、単なる技術的変数ではなく財務的変数である。GPUあたりのスループットが、購入すべきGPUの数を決め、素朴なサービングループと最新の推論エンジンの間の差は甚大である。
vLLMは、すぐに有効化されて出荷される2つの技術を通じて、本番環境でのデフォルトの選択肢となっている:
- 継続的バッチングは、バッチ全体が終わるのを待つのではなく、新規リクエストと処理中のリクエストを混ぜることで、すべてのGPUスロットを埋め続け、静的バッチングに比べてスループットを約2〜3倍に引き上げる。
- PagedAttentionは、連続したメモリを事前確保するのではなく、キーバリューキャッシュをブロック単位で管理し、断片化の無駄を削減し、同じカード上で2〜4倍多くの同時リクエストをサポートする。
GPU間のテンソル並列処理と量子化重みのサポートを組み合わせると、vLLMは素朴なtransformersサービングループの約24倍のスループットを実現する——つまり同じトラフィックに対して購入すべきGPUが約24分の1で済む。これらの技術なしでサイジングされたクラスターは、単に遅いだけでなく、資本的支出の誤りである。
ビジネスケースにとってさらに2つの特性が重要である。第一に、vLLMはOpenAI互換エンドポイントを公開しているため、大量トラフィックをAPIから移行するのは、書き換えではなく主にURLとキーの変更である——スイッチングコストは低く保たれる。第二に、制約:自社ホスティングできるのは、Llama、Qwen、DeepSeek、Mistralなどのオープンウェイトモデルのみである。大手ラボのフロンティアモデルはAPI専用のままであり、だからこそ一般的な最終形態はハイブリッドとなる:定型業務であるトラフィックの80パーセントにはオープンモデルを自社ホスティングし、フロンティアの推論を必要とする20パーセントはAPI経由でルーティングし続けるのだ。
自社ホスティング時に帳簿上で変わること
GPUサーバーが到着した日、あなたの会計は5箇所で変わる。これらを正しく行えば、あなたが実行した損益分岐の計算が実際に財務諸表に現れる。
1. ハードウェアが固定資産になる
購入したGPUサーバーは消耗品ではなく資本資産である。購入価格に加えて、クラスターを稼働状態にするための直接費——運送費、ラック設置、初期設定の労務費——を貸借対照表の固定資産として記録し、その後減価償却する。コンピュータおよび関連機器は一般に5年MACRS財産であり、減価償却は資産が供用開始(意図された用途に使用可能な状態)になった時点で始まり、請求書を支払った時点ではない。
少額購入を費用計上できる$2,500のde minimis safe harborは、GPUサーバーをカバーしない。$60,000のクラスターを事務用品経費で処理してはならない。
2. 2026年には本物の税務タイミングの選択肢がある
連邦税に関して、現行法は同じハードウェアに対して3つの速度を提供する:
- Section 179費用計上:2026年に供用開始した適格設備の最大**$2,560,000を控除でき、適格購入総額が$4,090,000**を超えると便益はドル対ドルで段階的に消滅する。控除額は課税事業所得を超えることはできないが、未使用額は繰り越される。
- 100パーセントボーナス減価償却:2025年1月19日以降に取得した適格財産について恒久的に復活した。Section 179とは異なり、損失を生じさせることができ、金額上限もない。
- 通常のMACRS:控除を5年にわたって分散する。
初めてクラスターを購入する収益性のある小規模事業は、多くの場合、全額を初年度に費用計上する。まだ利益が出ていないスタートアップは、相殺すべき所得がある年に控除を温存するMACRSを好むかもしれない。いずれにせよ、簿価と税務上の減価償却を別々に追跡せよ——確定申告が一度に全額を取る場合でも、財務諸表は資産の耐用年数にわたる経済的実態を反映すべきである。
3. レンタルGPUは営業費用のままである
時間単位でクラウドGPUをレンタルする場合、上記のいずれも当てはまらない。時間単位のレンタル、リザーブドインスタンス、GPUクラウドサブスクリプションは期間営業費用であり、所有よりもAPIの道に近い。これは正当な中間策である(初期資本なし、それでも従量制)が、レンタル請求から貸借対照表の資産や減価償却控除を期待してはならない。CapEx対OpExの決定と構築対購入の決定は、2つの別個の軸である。
4. 継続的なクラスターコストはCOGSとOpExに分かれる
稼働後は、コストをそれが支えるものによって分類せよ:
- COGSへ(顧客へのサービス提供に応じてスケールする):本番ノードの電力、サービングクラスターのコロケーションと帯域幅、本番の監視とログ、本番GPUの減価償却。
- 営業費用へ:エンジニアが実験するプロトタイプ用マシン、ステージング環境、一般的な研究開発インフラ。
同じ区分は労務にも当てはまる。本番推論を稼働させ続けるために費やしたエンジニアリング時間は提供を支え、COGSに置くことができる。来四半期のモデルを評価するために費やした時間は研究開発である。SaaSの粗利益率は通常70〜85パーセントでベンチマークされ、どちらの方向に誤分類してもあなたの利益率は比較不能になる——APIとホスティングの支出を間接費に入れれば、あなたの利益率は人為的に素晴らしく見え、OpExは膨張して見える。
5. 損益分岐を越えたら粗利益率は拡大すべきである
移行後、この恒等式を毎月監視せよ:COGS内のAPI行はゼロに向かって減少し(ハイブリッド構成ではフロンティアの残り20パーセントに向かって)、より小さな減価償却費とホスティング費の合計に置き換わるはずである。安定稼働から1〜2四半期以内に粗利益率が改善しなければ、稼働率がモデルより低いか、隠れた運営コストが節約を食い尽くしたかのどちらかである——それは決定を擁護するのではなく見直す合図である。
プレーンテキスト元帳では、購入自体は1つの貸借一致した仕訳である——現金から設備への資産の交換であり、減価償却仕訳が月ごとにコストを認識する。このように固定資産をモデル化したことがないなら、Beancountのドキュメントが勘定科目、減価償却の記帳、レポートを順を追って説明している。
節約を帳消しにする間違い
自社ホスティング移行の失敗のほとんどは、GPUベンチマークでは失敗しない。スプレッドシートが省いたコストで失敗する:
ピークに合わせてサイジングし、平均に対して支払う。 最も混雑する時間帯に合わせてプロビジョニングされたクラスターは、残りの時間は半分空で稼働する。すべてのアイドル時間はトークンを生まない減価償却である。オートスケーリングはレンタルGPUでは役立つが、自社ハードウェアでは、唯一の解決策は十分なベースライン量である。
運営のテールを忘れる。 ある詳細な分析では、控えめな4GPU構成でハードウェアに加えて月**$4,700〜$7,900**の隠れたコストを挙げている:月8〜20時間のエンジニアリング(総人件費で$2,500〜$5,000)、電力($400〜$600)、ネットワーキングとストレージ、監視、冗長用のスペア。そのいずれもGPU価格の比較には現れない。
稼働時間のギャップを無視する。 APIプロバイダーは通常99.9パーセントのSLA稼働時間を保証する。真剣な冗長化投資のない自社運用クラスターは、現実的には95〜99パーセントに落ち着く——カードの故障、メモリ不足によるクラッシュ、午前2時にデプロイを壊すCUDAドライバの更新。月10万ドルのAI駆動収益では、追加の1ポイントのダウンタイムはインシデント対応を数える前に月1,000ドルのコストとなる。
API支出を間接費として計上する。 推論コストが一般管理費ではなくCOGSに置かれている場合、あなたの粗利益率は両方向で虚構となる:移行前は過大表示され、移行後の改善は見えなくなる。比較する前に分類を修正せよ。
耐用年数の楽観主義。 一部のハイパースケーラーはGPUを5〜6年で減価償却するが、アナリストは各世代が前世代を陳腐化させる速さを考えれば経済的寿命は2〜3年に近いと主張する。次のアーキテクチャが出荷されたときにあなたのクラスターの再販価値が崩壊するなら、幻想の資産を抱えるのではなく減損を計上せよ。
プロトタイプ支出と本番の混在。 ファインチューニングを評価するために購入したGPUは研究開発である。顧客トラフィックを提供するクラスターは本番である。それらを1つの勘定に混ぜると、粗利益率と研究開発税額控除の裏付けの両方が損なわれる。
購入前の意思決定チェックリスト
雰囲気ではなく実際の数字で、これら6つの質問を検討せよ:
- 量:持続的な月間API支出は約$20,000を超えているか、または2四半期以内にそこに到達する見込みが確かにあるか?
- どのAPIを置き換えるか? プレミアムなフロンティア価格は月約10億トークンで損益分岐する。低予算なAPI価格は決して損益分岐しないかもしれない。
- トラフィック形状:負荷はGPUが稼働し続けるほど平坦か、それともピーク時のプロビジョニングが容量を遊ばせるか?
- 専門知識:チームの誰かがすでにCUDA、量子化、vLLMチューニングを話せるか——それとも回収計算に採用を組み込んでいるか?
- 現金と税金:初期資本を賄えるか、そしてSection 179またはボーナス控除を使うだけの所得があるか——それともMACRSの方が良いか?
- 非財務的推進要因:プライバシー、コンプライアンス、または100ミリ秒未満のレイテンシ要件が、コストに関係なく自社ホスティングを強制するか?
弱い答えが3つ以上あれば、今はAPI(またはハイブリッド分割)にとどまるべきである。あなたの量がそこまで成長したとき、ラインはまだそこにある——そしてその頃には、次のGPU世代がそれをあなたに有利な方向へ動かしているだろう。
推論支出を可読なままに保つ
トークンあたりで支払うにせよ、減価償却スケジュールあたりで支払うにせよ、推論は今やあなたの最大のコスト行の1つであり、損益計算書上の1つの謎の合計よりも良い扱いに値する。API支出をホスティングから、本番GPUをプロトタイプ用マシンから、簿価減価償却を税務上の減価償却から分離することが、損益分岐ラインを一度きりの計算から毎月監視できる数字へと変えるのである。
Beancount.ioはプレーンテキスト会計を提供し、あなたの財務データに完全な透明性と制御をもたらす——ブラックボックスなし、ベンダーロックインなし。クラスターを固定資産として追跡し、予定どおりに減価償却を記帳し、それがFavaのレポートを通じて流れるのを監視せよ。無料で始めることで、AIインフラ支出をインフラコードと同じくらい可読に保とう。





