你的 API 账单与你的成功完美同步增长。每来一个新客户就增加 token,每增加一个 token 就增加成本,而全部金额每个月都计入你的销货成本。在某个规模上,那张按量计费的账单会越过一条线:直接买下 GPU 并自己运行推理,会比租用别人的更便宜。问题是这条线对你来说在哪里——因为跨过它不仅仅是一个工程决策。它会改写你的资产负债表、你的毛利率和你的纳税申报表。
本指南将带你走过盈亏平衡的计算,说明为什么 vLLM 推理栈把这条线移动了,以及在你停止把 API 调用费用化的那天、开始把 GPU 集群资本化时,账面上会发生什么变化。
为推理付费的两种方式
你的产品所服务的每一个 token,都是通过两种方式之一付费的,而它们对你的财务影响完全不同。
API 路径是纯粹的运营费用。 你按每百万 token 付费,账单随使用量增长,全部金额都是期间成本——最自然地记为销货成本,因为推理与向客户交付产品直接相关。零前期投入、零资产、零折旧。无论你变得多大,你的毛利率每个月都以固定比率承受冲击。
自托管路径主要是资本支出。 你购买 GPU 服务器(或签订长期预留),在资产负债表上记入一项固定资产,并在其使用寿命内计提折旧。你的月度损益表随后显示的是折旧加上运营成本——电费、托管或机架空间、监控,以及保持集群健康运转的工程工时——而不是按 token 计费的账单。
这种结构性差异就是全部的关键。API 成本永远随业务量线性增长。自托管成本前期集中且大多是固定的,因此随着利用率上升,每 token 的有效成本会下降。在某个点上,这两条曲线会相交。下面的一切都是为了找出这个点在哪里。
盈亏平衡的计算
一份被广泛引用的 2026 年分析,研究了超过 50 个生产部署,给出的经验法则大约在每月 20,000 美元的 API 支出。低于这个数字,运营自己集群的工程和运营成本几乎总会超过节省下来的钱。高于每月 50,000 美元,将大部分流量自托管通常能省下 50% 到 70%。在这两条线之间是一片灰色地带,具体细节——你的模型、你的流量形态、你团队的 GPU 经验——起决定作用。
同一份分析还勾勒了这些数字背后的投入:前期 50,000 到 500,000 美元用于 GPU 硬件,视模型规模而定,外加每月 3,000 到 15,000 美元的持续运营成本。这涵盖了从一台用来服务 700 亿参数模型的二手 A100 级机器,到多节点 H100 集群的各种情况。
你替换的是哪个 API,这一点至关重要
根据你今天每 token 支付的价格不同,盈亏平衡的业务量会相差大约 100 倍:
| 每月业务量 | 前沿 API 成本(约) | 自托管成本(自有硬件) | 每月节省 |
|---|---|---|---|
| 1 亿 token | $1,750 | $5,500 | -$3,750(亏损) |
| 5 亿 token | $8,750 | $7,500 | $1,250(20 个月回本) |
| 10 亿 token | $17,500 | $10,000 | $7,500(7 个月回本) |
| 50 亿 token | $87,500 | $25,000 | $62,500(1 个月回本) |
对照一个每 1 亿 token 收费约 $1,750 的高端前沿 API,交叉点落在每月五亿到十亿 token 左右,而从那里开始回本速度急剧加快。
但如果你替换的是一个每 1 亿 token 收费接近 $80 的廉价 API,计算就会反过来:你需要每月 500 亿以上的 token 才能盈亏平衡——这个业务量需要一个正经的多 GPU 集群和一个专职基础设施团队。如果一个廉价 API 达到了你的质量门槛,那么对于一家小企业所能达到的任何业务量而言,自托管都很少在财务上说得通。
利用率就是一切
其他成本拆解得出的盈亏平衡点要低得多——一个详细的自建对比租用模型把它放在每月约 4,200 美元的 API 支出——而各估算之间的差距本身就是这堂课:不存在普适的盈亏平衡点。 整个计算取决于利用率。一块 24 小时服务稳定流量的 GPU,把它的固定成本摊到数十亿 token 上。同一块 GPU 如果只服务白天忽高忽低的流量,整夜闲置,一边折旧一边毫无产出,而这些闲置时间会悄悄地把你的真实每 token 成本抬高两到三倍。
在相信任何人的盈亏平衡数字(包括本文的)之前,先测量你自己的流量形态:持续每秒 token 数、峰均比和增长斜率。平稳、可预测、持续增长的流量有利于自托管。忽高忽低或低量的流量有利于 API 的零闲置成本。
为什么 vLLM 移动了这条线
你选择的推理栈是一个财务变量,而不只是技术变量。每 GPU 的吞吐量决定了你必须买多少 GPU,而一个朴素的推理循环和一个现代推理引擎之间的差距是巨大的。
vLLM 通过两项开箱即用的技术,已成为生产环境中的默认选择:
- 连续批处理通过在混合新请求和进行中请求的同时填满每一个 GPU 槽位,而不是等待整批完成,相比静态批处理把吞吐量提升了约 2 到 3 倍。
- PagedAttention 以块为单位管理键值缓存,而不是预先分配连续内存,减少了碎片浪费,并在同一张卡上支持 2 到 4 倍的并发请求。
结合跨 GPU 的张量并行和对量化权重的支持,vLLM 的吞吐量大约是一个朴素 transformers 推理循环的 24 倍——这意味着同样的流量所需的 GPU 购买量大约少了 24 倍。一个没有采用这些技术来规划规模的集群不只是更慢;它是一个资本支出层面的错误。
还有两个特性对商业论证很重要。第一,vLLM 提供 OpenAI 兼容的端点,因此把大部分流量从 API 迁移过来基本上只是改个 URL 和密钥,而不是重写代码——切换成本保持很低。第二,约束条件:你只能自托管开放权重模型,例如 Llama、Qwen、DeepSeek 和 Mistral。大实验室的前沿模型仍然只能通过 API 使用,这就是为什么常见的最终状态是混合模式:为 80% 的常规流量自托管一个开放模型,把需要前沿推理的那 20% 继续通过 API 路由。
自托管后你的账面会发生什么变化
GPU 服务器到货的那天,你的会计处理会在五个地方发生变化。把这些做对,你跑过的盈亏平衡计算才会真正体现在你的财务报表中。
1. 硬件变成一项固定资产
购买的 GPU 服务器是资本资产,而不是耗材。你把购买价格加上使集群投入使用的直接成本——运费、机架安装、初始配置的人工——记入资产负债表上的一项固定资产,然后计提折旧。计算机及相关设备一般属于 5 年期 MACRS 财产,折旧从资产投入使用(已就绪并可用于其预期用途)时开始,而不是在你支付发票时开始。
让你可以费用化小额购买的 $2,500 最低限额安全港不会覆盖 GPU 服务器。不要把 6 万美元的集群走办公用品科目。
2. 在 2026 年你有一个真正的税务时点选择
对于联邦税,现行法律给了你同一批硬件的三种折旧速度:
- Section 179 费用化:2026 年投入使用的合格设备最多可扣除 $2,560,000,一旦合格购买总额超过 $4,090,000,优惠就按美元对美元逐步取消。扣除额不能超过你的应税营业收入,但未使用的金额可以结转。
- 100% 奖金折旧:对 2025 年 1 月 19 日之后取得的合格财产已永久恢复。与 Section 179 不同,它可以产生亏损,而且没有金额上限。
- 常规 MACRS:把扣除额分摊到 5 年。
一家盈利的小企业购买它的第一个集群时,往往会在第一年就把整笔费用化。一家尚未盈利的初创公司可能更倾向 MACRS,把扣除留给有收入可抵扣的年份。无论哪种方式,都要分别跟踪账面折旧和税务折旧——即使纳税申报表一次性扣完,你的财务报表也应反映资产使用寿命内的经济现实。
3. 租用的 GPU 仍然是运营费用
如果你按小时租用云 GPU,上述内容都不适用。按小时租赁、预留实例和 GPU 云订阅都是期间运营成本——更接近 API 路径而非购买。那是一个合理折中方案(没有前期资本,仍然是按量计费),但不要指望从租赁账单中得到一项资产负债表资产或一笔折旧扣除。资本支出与运营支出的决策,和自建与购买的决策,是两条独立的轴。
4. 持续的集群成本在 COGS 和 OpEx 之间拆分
一旦运行起来,就按成本所支持的东西来分类:
- 计入 COGS(它们随服务客户而增长):生产节点的电费、服务集群的托管和带宽、生产的监控和日志,以及生产 GPU 的折旧。
- 计入运营费用:你的工程师用来做实验的原型机、预发环境,以及一般研发基础设施。
同样的划分适用于人工。用于保持生产推理在线的工程时间支持交付,可以放在 COGS;用于评估下季度模型的时间属于研发。SaaS 毛利率通常以 70% 到 85% 为基准,任何方向的错误分类都会让你的毛利率失去可比性——把 API 和托管支出放进管理费用,你的毛利率看起来会好得不真实,而你的 OpEx 看起来会臃肿不堪。
5. 跨过盈亏平衡线后你的毛利率应该扩张
迁移后每月观察这个恒等式:COGS 中的 API 科目应趋近于零(在混合模式下趋近于那 20% 的前沿部分),被一个更小的折旧加托管合计数字所取代。如果进入稳态运营一到两个季度后毛利率仍未改善,要么是利用率低于建模值,要么是隐藏的运营成本吃掉了节省——这是你重新审视这个决策的信号,而不是为它辩护。
在纯文本账本中,购买本身是一笔平衡的分录——从现金到设备的资产交换,随后折旧分录逐月确认成本。如果你从未这样为固定资产建模,Beancount 文档会一步步带你了解账户、折旧记账和报表。
抹掉节省的错误
大多数失败的自托管迁移不是败在 GPU 基准测试上。它们败在电子表格遗漏的成本上:
按峰值选型,却按平均值付费。 为最繁忙时段配置的集群,一天里其余时间半空运行。每一个闲置小时都是没有产出 token 的折旧。自动扩缩在租用的 GPU 上有用;在自有硬件上,唯一的解法是足够的基线业务量。
忘记运营的长尾。 一份详细的拆解把一台普通 4-GPU 配置的隐藏月度成本定在硬件之外的 $4,700 到 $7,900:每月 8 到 20 个工程小时(按含福利薪资算 $2,500 到 $5,000)、电费($400 到 $600)、网络和存储、监控,以及一台冗余备件。这些都不会出现在 GPU 价格对比中。
忽视正常运行时间差距。 API 提供商通常保证 99.9% 的 SLA 正常运行时间。一个没有认真投入冗余的自建集群,现实中落在 95% 到 99%——卡故障、内存溢出崩溃、一次凌晨两点搞坏部署的 CUDA 驱动更新。在每月 10 万美元的 AI 驱动收入上,多一个百分点的停机每月就损失 $1,000,还没算上事件响应。
把 API 支出记为管理费用。 如果推理成本放在一般费用而不是 COGS,你的毛利率在两个方向上都是虚构的:迁移前被高估,而迁移后的改善又看不见。在比较之前先修正分类。
对使用寿命过于乐观。 一些超大规模厂商按 5 到 6 年折旧 GPU,而分析师认为,鉴于每一代都在如此快地淘汰上一代,经济寿命更接近 2 到 3 年。如果你集群的转售价值在下一代架构发布时崩盘,那就计提减值,而不是挂着一项幻想中的资产。
把原型支出和生产支出混在一起。 你买来评估微调的 GPU 属于研发。服务客户流量的集群属于生产。把它们混在一个科目里,会同时破坏你的毛利率和你的研发税收抵免支撑。
购买前的决策清单
用真实数字而不是感觉来回答这六个问题:
- 业务量:持续每月 API 支出是否超过大约 $20,000,或在两个季度内可信地朝这个方向前进?
- 你替换的是哪个 API? 高端前沿定价在每月约十亿 token 附近盈亏平衡;廉价 API 定价可能永远无法盈亏平衡。
- 流量形态:负载是否足够平稳,让 GPU 保持忙碌,还是按峰值配置会闲置容量?
- 专业能力:团队里是否已经有人懂 CUDA、量化和 vLLM 调优——还是你正在把一次招聘算进回本计算里?
- 现金和税务:你能为前期资本提供资金吗,你有收入来使用 Section 179 或奖金折旧吗——还是 MACRS 对你更有利?
- 非财务驱动因素:隐私、合规或低于 100 毫秒的延迟要求是否无论成本如何都迫使你自托管?
有三个或更多答案偏弱,就意味着现在先留在 API(或混合拆分)上。当你的业务量增长到这条线时,这条线仍会在那里——而到那时,下一代 GPU 已经把它朝有利于你的方向移动了。
让你的推理支出清晰可读
无论你是按 token 付费还是按折旧计划付费,推理现在都是你最大的成本项目之一,它值得比损益表上一个神秘的总数更好的对待。把 API 支出与托管分开、把生产 GPU 与原型机分开、把账面折旧与税务折旧分开,正是这些让盈亏平衡线从一次性计算变成一个你可以每月观察的数字。
Beancount.io 提供纯文本会计,让你对自己的财务数据拥有完全的透明度和控制——没有黑箱,没有供应商锁定。把集群作为固定资产跟踪,按计划计提折旧,并看着它流入你在 Fava 中的报表。免费开始使用,让你的 AI 基础设施支出像你的基础设施代码一样清晰可读。





