Перейти к основному содержимому

Точка безубыточности GPU: когда собственный кластер vLLM выгоднее счёта за LLM API

Опубликовано 12 мин чтенияMike ThriftMike Thrift
Точка безубыточности GPU: когда собственный кластер vLLM выгоднее счёта за LLM API
Содержание страницы

Ваш счёт за API растёт в идеальном тандеме с вашим успехом. Каждый новый клиент добавляет токены, каждый токен добавляет расходы, и вся эта сумма попадает в вашу себестоимость продаж каждый месяц. При определённом объёме этот оплачиваемый по счётчику bill пересекает черту: купить GPU напрямую и запускать инференс самостоятельно становится дешевле, чем арендовать чужой. Вопрос в том, где проходит эта черта именно для вас — потому что её пересечение не просто инженерное решение. Оно переписывает ваш баланс, вашу валовую маржу и вашу налоговую декларацию.

Это руководство разбирает математику безубыточности, почему стек обслуживания vLLM сдвинул эту черту и что меняется в вашей бухгалтерии в тот день, когда вы перестаёте списывать расходы на API и начинаете капитализировать кластер GPU.

Два способа оплачивать инференс​

Каждый токен, который обслуживает ваш продукт, оплачивается одним из двух способов, и они абсолютно по-разному отражаются на ваших финансах.

Путь через API — это чистые операционные расходы. Вы платите за миллион токенов, счёт масштабируется с использованием, и вся сумма является расходом периода — наиболее естественно относится на себестоимость продаж, поскольку инференс напрямую связан с доставкой вашего продукта клиентам. Ноль предоплаты, ноль активов, ноль амортизации. Ваша валовая маржа несёт удар каждый месяц с постоянной скоростью, независимо от того, насколько вы выросли.

Путь через собственный хостинг — это в основном капитальные затраты. Вы покупаете GPU-серверы (или заключаете долгосрочную резервацию), ставите основной актив на баланс и амортизируете его в течение срока полезного использования. Ваш ежемесячный P&L тогда показывает амортизацию плюс операционные расходы — электроэнергию, колокейшн или стойко-место, мониторинг и инженерные часы, которые поддерживают кластер в рабочем состоянии — вместо счёта за каждый токен.

Эта структурная разница — вся суть игры. Расходы на API масштабируются линейно с объёмом навсегда. Расходы на собственный хостинг фронтально нагружены и в основном фиксированы, поэтому эффективная стоимость за токен падает по мере роста загрузки. Где-то эти две кривые пересекаются. Всё нижесказанное — о том, как найти эту точку.

Математика безубыточности​

Широко цитируемый анализ 2026 года более чем 50 производственных внедрений установил эмпирическое правило примерно в $20 000 в месяц расходов на API. Ниже этого порога инженерные и операционные затраты на управление собственным кластером почти всегда превышают экономию. Выше $50 000 в месяц самостоятельный хостинг основной части трафика обычно выигрывает на 50–70 процентов. Между этими линиями находится серая зона, где решение определяют детали — ваши модели, характер вашего трафика, опыт вашей команды с GPU.

Тот же анализ обрисовал инвестиции, стоящие за этими цифрами: $50 000 – $500 000 предварительно на GPU-оборудование в зависимости от размера модели, плюс $3 000 – $15 000 в месяц на текущие операции. Это диапазон от одной подержанной машины класса A100, обслуживающей модель с 70 миллиардами параметров, до многоузлового кластера H100.

Чрезвычайно важно, какой именно API вы заменяете​

Объём безубыточности смещается примерно в 100 раз в зависимости от того, сколько вы платите за токен сегодня:

Месячный объёмСтоимость фронтирного API (прибл.)Стоимость собственного хостинга (своё оборудование)Месячная экономия
100 млн токенов$1 750$5 500-$3 750 (убыток)
500 млн токенов$8 750$7 500$1 250 (окупаемость за 20 месяцев)
1 млрд токенов$17 500$10 000$7 500 (окупаемость за 7 месяцев)
5 млрд токенов$87 500$25 000$62 500 (окупаемость за 1 месяц)

Против премиального фронтирного API, берущего порядка $1 750 за 100 миллионов токенов, точка перехода оказывается где-то между половиной миллиарда и миллиардом токенов в месяц, и окупаемость резко ускоряется дальше.

Но если заменить бюджетный API, берущий ближе к $80 за 100 миллионов токенов, математика переворачивается: вам потребовалось бы более 50 миллиардов токенов в месяц для безубыточности — объём, требующий серьёзного многогpu-кластера и выделенной инфраструктурной команды. Если дешёвый API удовлетворяет вашей планке качества, собственный хостинг редко имеет финансовый смысл при любом объёме, достижимом для малого бизнеса.

Загрузка — это всё​

Другие разборы затрат опускают точку безубыточности гораздо ниже — одна детальная модель «построить против арендовать» ставит её около $4 200 в месяц расходов на API — и разрыв между оценками сам по себе является уроком: универсальной точки безубыточности не существует. Весь расчёт зависит от загрузки. GPU, обслуживающий стабильный трафик круглосуточно, распределяет свою фиксированную стоимость по миллиардам токенов. Тот же GPU, обслуживающий пиковый дневной трафик, простаивает всю ночь, амортизируясь без всякой отдачи, и часы простоя тихо удваивают или утраивают вашу истинную стоимость за токен.

Прежде чем доверять чьей-либо цифре безубыточности, включая цифру из этой статьи, измерьте форму собственного трафика: устойчивые токены в секунду, соотношение пика к среднему и наклон роста. Ровный, предсказуемый, растущий объём благоприятствует собственному хостингу. Пиковый или малый объём благоприятствует нулевой стоимости простоя API.

Почему vLLM сдвинул эту черту​

Выбранный вами стек обслуживания — это финансовая переменная, а не просто техническая. Пропускная способность на GPU определяет, сколько GPU вам нужно купить, и разрыв между наивным циклом обслуживания и современным движком инференса огромен.

vLLM стал стандартным производственным выбором благодаря двум техникам, включённым из коробки:

  • Непрерывная батчинг (continuous batching) поддерживает заполненность каждого слота GPU, смешивая новые и уже обрабатываемые запросы вместо ожидания завершения целого батча, что повышает пропускную способность примерно в 2–3 раза по сравнению со статическим батчингом.
  • PagedAttention управляет кэшем ключей-значений блоками вместо предварительного выделения непрерывной памяти, сокращая потери на фрагментацию и поддерживая в 2–4 раза больше одновременных запросов на той же карте.

В сочетании с тензорным параллелизмом между GPU и поддержкой квантованных весов vLLM обеспечивает порядка 24-кратной пропускной способности наивного цикла обслуживания на transformers — что означает примерно в 24 раза меньше GPU для покупки при том же трафике. Кластер, спроектированный без этих техник, не просто медленнее; это ошибка в капитальных затратах.

Ещё два свойства важны для бизнес-кейса. Во-первых, vLLM предоставляет эндпоинты, совместимые с OpenAI, поэтому миграция массового трафика с API — это в основном смена URL и ключа, а не переписывание кода — стоимость переключения остаётся низкой. Во-вторых, ограничение: вы можете самостоятельно хостить только модели с открытыми весами, такие как Llama, Qwen, DeepSeek и Mistral. Фронтирные модели от крупных лабораторий остаются доступными только через API, поэтому типичное конечное состояние — гибрид: самостоятельно хостить открытую модель для 80 процентов трафика, который рутинен, и продолжать направлять 20 процентов, требующих фронтирного рассуждения, через API.

Что меняется в вашей бухгалтерии при переходе на собственный хостинг​

В день прибытия GPU-серверов ваша бухгалтерия меняется в пяти местах. Разберитесь с ними правильно, и математика безубыточности, которую вы рассчитали, действительно проявится в ваших финансах.

1. Оборудование становится основным активом​

Купленные GPU-серверы — это капитальные активы, а не расходные материалы. Вы записываете цену покупки плюс прямые затраты на ввод кластера в эксплуатацию — доставку, установку в стойку, труд на первоначальную настройку — как основной актив на балансе, а затем амортизируете его. Компьютеры и связанное оборудование обычно относятся к 5-летнему имуществу MACRS, и амортизация начинается, когда актив введён в эксплуатацию (готов и доступен для предполагаемого использования), а не когда вы оплачиваете счёт.

Порог de minimis в $2 500, позволяющий списывать мелкие покупки, не покроет GPU-сервер. Не проводите кластер за $60 000 через канцелярские расходы.

2. В 2026 году у вас есть настоящий выбор налогового тайминга​

Для федеральных налогов действующее законодательство даёт вам три скорости для одного и того же оборудования:

  • Списание по Section 179: вычет до $2 560 000 квалифицирующегося оборудования, введённого в эксплуатацию в 2026 году, с сокращением льготы доллар за доллар, как только общие квалифицирующиеся покупки превысят $4 090 000. Вычет не может превышать ваш налогооблагаемый доход от бизнеса, но неиспользованные суммы переносятся на будущее.
  • 100-процентная бонусная амортизация: навсегда восстановлена для квалифицирующегося имущества, приобретённого после 19 января 2025 года. В отличие от Section 179, она может создавать убыток и не имеет долларового лимита.
  • Обычная MACRS: распределяет вычет на 5 лет.

Прибыльный малый бизнес, покупающий свой первый кластер, часто списывает всё в первый год. Убыточный стартап может предпочесть MACRS, сохраняя вычеты для лет, когда есть доход для зачёта. В любом случае отслеживайте бухгалтерскую и налоговую амортизацию отдельно — ваша финансовая отчётность должна отражать экономическую реальность на протяжении срока полезного использования актива, даже когда налоговая декларация берёт всё сразу.

3. Арендованные GPU остаются операционными расходами​

Ничего из вышесказанного не применимо, если вы арендуете облачные GPU по часам. Почасовая аренда, зарезервированные инстансы и подписки на GPU-облака — это операционные расходы периода, ближе к пути через API, чем к владению. Это законная золотая середина (без предварительного капитала, но всё ещё по счётчику), но не ожидайте актива на балансе или амортизационного вычета от арендного счёта. Решение CapEx против OpEx и решение «построить против купить» — это две отдельные оси.

4. Текущие затраты кластера делятся между COGS и OpEx​

После запуска классифицируйте затраты по тому, что они поддерживают:

  • В COGS (они масштабируются с обслуживанием клиентов): электроэнергия для производственных узлов, колокейшн и пропускная способность для обслуживающего кластера, мониторинг и логирование для продакшена, а также амортизация производственных GPU.
  • В операционные расходы: прототипная машина, на которой экспериментируют ваши инженеры, стейджинг-среды и общая инфраструктура R&D.

То же разделение применяется к труду. Инженерное время, потраченное на поддержание производственного инференса, поддерживает доставку и может относиться на COGS; время, потраченное на оценку модели следующего квартала, — это R&D. Валовую маржу SaaS обычно бенчмаркируют на уровне 70–85 процентов, и неправильная классификация в любую сторону делает вашу маржу несопоставимой — отнесите расходы на API и хостинг к накладным, и ваша маржа будет выглядеть искусственно прекрасной, а OpEx — раздутым.

5. Ваша валовая маржа должна расти после точки безубыточности​

Следите за этим тождеством ежемесячно после миграции: строка API в COGS должна падать к нулю (или к 20-процентному фронтирному остатку в гибридной схеме), замещаясь меньшей комбинированной цифрой амортизации плюс хостинга. Если валовая маржа не улучшается в течение квартала-двух стабильной работы, значит либо загрузка ниже смоделированной, либо скрытые операционные затраты съели экономию — это сигнал вернуться к решению, а не защищать его.

В текстовом реестре сама покупка — это одна сбалансированная проводка: обмен активов с денег на оборудование, с проводками амортизации, признающими расход месяц за месяцем. Если вы никогда не моделировали основные активы таким образом, документация Beancount пошагово проводит через счета, проводки амортизации и отчёты.

Ошибки, которые стирают экономию​

Большинство неудачных миграций на собственный хостинг проваливаются не на бенчмарках GPU. Они проваливаются на затратах, которые опустила таблица:

Проектирование под пик, оплата по среднему. Кластер, рассчитанный на ваш самый загруженный час, работает вполовину пустым в остальное время. Каждый час простоя — это амортизация без токенов. Автомасштабирование помогает на арендованных GPU; на собственном оборудовании единственное решение — достаточный базовый объём.

Забытый операционный хвост. Один детальный разбор оценивает скрытые месячные затраты в $4 700 – $7 900 сверх оборудования для скромной установки на 4 GPU: 8–20 инженерных часов в месяц ($2 500 – $5 000 при полной стоимости зарплаты), электроэнергия ($400 – $600), сеть и хранилище, мониторинг и резервный запасной компонент. Ничего из этого не появляется в сравнении цен на GPU.

Игнорирование разрыва в доступности. Провайдеры API обычно гарантируют 99,9 процента доступности по SLA. Самостоятельно управляемый кластер без серьёзных инвестиций в резервирование реалистично даёт 95–99 процентов — отказавшие карты, сбои из-за нехватки памяти, обновление драйвера CUDA, ломающее развёртывание в 2 часа ночи. При $100 000 в месяц дохода, движимого ИИ, один дополнительный процент простоя стоит $1 000 в месяц, не считая реагирования на инциденты.

Отнесение расходов на API к накладным. Если затраты на инференс находятся в общих расходах, а не в COGS, ваша валовая маржа — фикция в обе стороны: завышена до миграции, а улучшение после миграции невидимо. Исправьте классификацию, прежде чем сравнивать.

Оптимизм по сроку полезного использования. Некоторые гиперскейлеры амортизируют GPU за 5–6 лет, тогда как аналитики утверждают, что экономический срок ближе к 2–3 годам, учитывая, как быстро каждое поколение устаревает предыдущее. Если остаточная стоимость вашего кластера обваливается с выходом следующей архитектуры, отразите обесценение, а не несёте фантазийный актив.

Смешение прототипных расходов с производственными. GPU, купленный для оценки fine-tuning, — это R&D. Кластер, обслуживающий клиентский трафик, — это продакшен. Смешение их на одном счёте портит и вашу валовую маржу, и обоснование налогового кредита на R&D.

Чек-лист решений перед покупкой​

Пройдитесь по этим шести вопросам с реальными цифрами, а не с ощущениями:

  1. Объём: устойчивые месячные расходы на API выше примерно $20 000 или достоверно приближаются к этому в течение двух кварталов?
  2. Какой API вы заменяете? Премиальное фронтирное ценообразование даёт безубыточность около миллиарда токенов в месяц; бюджетное ценообразование API может никогда не окупиться.
  3. Форма трафика: достаточно ли ровная нагрузка, чтобы GPU оставались занятыми, или пиковое резервирование оставит мощность простаивать?
  4. Экспертиза: кто-то в команде уже говорит на CUDA, квантизации и настройке vLLM — или вы закладываете найм в математику окупаемости?
  5. Деньги и налоги: можете ли вы финансировать предварительный капитал и есть ли у вас доход, чтобы использовать вычет по Section 179 или бонусный вычет — или MACRS подошёл бы лучше?
  6. Нефинансовые драйверы: требуют ли конфиденциальность, комплаенс или задержка ниже 100 мс собственного хостинга независимо от стоимости?

Три или более слабых ответа означают, что пока стоит оставаться на API (или на гибридном разделении). Черта всё ещё будет там, когда ваш объём до неё дорастёт — и к тому времени следующее поколение GPU сдвинет её в вашу пользу.

Держите расходы на инференс прозрачными​

Платите ли вы за токен или по графику амортизации, инференс теперь одна из ваших крупнейших строк затрат, и он заслуживает большего, чем одна загадочная итоговая цифра в P&L. Разделение расходов на API от хостинга, производственных GPU от прототипных машин и бухгалтерской амортизации от налоговой — это то, что превращает точку безубыточности из разового расчёта в число, за которым можно следить каждый месяц.

Beancount.io предлагает текстовую бухгалтерию, дающую вам полную прозрачность и контроль над вашими финансовыми данными — никаких чёрных ящиков, никакой привязки к поставщику. Отслеживайте кластер как основной актив, проводите амортизацию по графику и наблюдайте, как она проходит через ваши отчёты в Fava. Начните бесплатно и держите расходы на вашу ИИ-инфраструктуру такими же прозрачными, как ваш инфраструктурный код.

Источник: https://beancount.io/ru/blog/2026/10/10/gpu-breakeven-line-self-hosted-vllm-vs-llm-api-cogs-guide

Опубликовано: 10 октября 2026 г.

8 мин чтения

Графики амортизации GPU: объяснение того, как одна оценка превращает 60% маржу в убыток в $1 миллиард

CoreWeave зафиксировала выручку в $5,13 миллиарда и скорректированную маржу…

depreciation
fixed-assets
9 мин чтения

Затраты на API LLM — это COGS, а не накладные расходы: руководство по валовой марже для AI-обёрток

Инференс LLM — это переменная затрата на доставку вашего продукта, а не…

cost-of-goods-sold
ai
11 мин чтения

Сдаёте GPU в аренду на Vast.ai или RunPod? Почему счёт за электричество и график амортизации относятся к Schedule C, а не к вашим личным коммунальным платежам

Доход от аренды GPU — это доход по Schedule C: вычитайте измеренное…

side-hustle
tax-deductions
8 мин чтения

Объяснение рекуперации амортизации: налоговый счет, ожидающий вас при продаже самортизированного оборудования или недвижимости

Рекуперация амортизации облагает налогом вычеты, которые вы уже использовали,…

depreciation
fixed-assets
11 мин чтения

Уходите из облака в стойку колокации? Этот шаг меняет график амортизации, а не только ежемесячный счёт

Уход из облака в стойку колокации превращает opex в capex — серверы относятся к…

depreciation
fixed-assets