Перейти до основного вмісту

Точка беззбитковості GPU: коли власний кластер vLLM перемагає рахунок за LLM API

Опубліковано 12 хв. читанняMike ThriftMike Thrift
Точка беззбитковості GPU: коли власний кластер vLLM перемагає рахунок за LLM API
Зміст цієї сторінки

Ваш рахунок за API зростає в ідеальному тандемі з вашим успіхом. Кожен новий клієнт додає токени, кожен токен додає витрат, і вся ця сума щомісяця потрапляє у вашу собівартість реалізованої продукції. На певному обсязі цей вимірюваний рахунок перетинає межу: купити GPU напряму й запускати інференс самостійно стає дешевше, ніж орендувати чужі. Питання в тому, де саме ця межа проходить для вас — бо її перетин не є просто інженерним рішенням. Він переписує ваш баланс, вашу валову маржу та вашу податкову декларацію.

Цей посібник розбирає математику беззбитковості, пояснює, чому стек обслуговування vLLM зсунув цю межу, і що змінюється у вашій звітності того дня, коли ви припиняєте списувати витрати на API-виклики у видатки й починаєте капіталізувати кластер GPU.

Два способи платити за інференс​

Кожен токен, який обслуговує ваш продукт, оплачується одним із двох способів, і вони впливають на вашу фінансову звітність абсолютно по-різному.

Шлях через API — це чисті операційні витрати. Ви платите за мільйон токенів, рахунок масштабується разом із використанням, і вся сума є витратами періоду — найприродніше їх відносити до собівартості реалізованої продукції, оскільки інференс безпосередньо пов'язаний із наданням вашого продукту клієнтам. Нуль авансом, нуль активів, нуль амортизації. Ваша валова маржа зазнає удару щомісяця за постійною ставкою, незалежно від того, наскільки ви виросли.

Шлях власного розміщення — це переважно капітальні видатки. Ви купуєте сервери GPU (або укладаєте довгострокову резервацію), ставите основний засіб на баланс і амортизуєте його протягом строку корисної експлуатації. Ваш щомісячний звіт про прибутки та збитки тоді показує амортизацію плюс операційні витрати — електроенергію, колокацію чи стійкове місце, моніторинг та інженерні години, які підтримують кластер у робочому стані — замість рахунку за токени.

Ця структурна різниця — це вся суть. Витрати на API зростають лінійно разом з обсягом назавжди. Витрати на власне розміщення зосереджені на початку й переважно фіксовані, тож ефективна вартість за токен падає зі зростанням завантаження. Десь ці дві криві перетинаються. Усе нижче — про те, як знайти цю точку.

Математика беззбитковості​

Широко цитований аналіз 2026 року, що охопив понад 50 виробничих впроваджень, визначив орієнтовне правило на рівні приблизно $20 000 на місяць витрат на API. Нижче цього рівня інженерні й операційні витрати на утримання власного кластера майже завжди перевищують економію. Вище $50 000 на місяць самостійне розміщення основного трафіку зазвичай виграє на 50–70 відсотків. Між цими межами лежить сіра зона, де все вирішують деталі — ваші моделі, характер вашого трафіку, досвід вашої команди з GPU.

Той самий аналіз окреслив інвестиції, що стоять за цими цифрами: від $50 000 до $500 000 авансом на апаратне забезпечення GPU залежно від розміру моделі, плюс від $3 000 до $15 000 на місяць на поточні операції. Це діапазон від однієї вживаної машини класу A100, що обслуговує модель на 70 мільярдів параметрів, до багатовузлового кластера H100.

Надзвичайно важливо, який саме API ви замінюєте​

Обсяг беззбитковості змінюється приблизно у 100 разів залежно від того, скільки ви платите за токен сьогодні:

Місячний обсягВартість передового API (приблизно)Вартість власного розміщення (власне обладнання)Місячна економія
100 млн токенів$1 750$5 500-$3 750 (збиток)
500 млн токенів$8 750$7 500$1 250 (окупність за 20 місяців)
1 млрд токенів$17 500$10 000$7 500 (окупність за 7 місяців)
5 млрд токенів$87 500$25 000$62 500 (окупність за 1 місяць)

Проти передового API преміумкласу, що стягує близько $1 750 за 100 мільйонів токенів, точка переходу припадає десь на пів мільярда – мільярд токенів на місяць, і далі окупність стрімко прискорюється.

Але замініть бюджетний API, що стягує ближче до $80 за 100 мільйонів токенів, і математика перевертається: вам знадобиться понад 50 мільярдів токенів на місяць, щоб вийти на беззбитковість — обсяг, який вимагає серйозного багатопроцесорного кластера та відданої інфраструктурної команди. Якщо дешевий API відповідає вашим вимогам до якості, самостійне розміщення рідко має фінансовий сенс за будь-якого обсягу, якого досягне малий бізнес.

Завантаження — це все​

Інші розрахунки витрат дають точку беззбитковості значно нижче — одна детальна модель «побудувати проти орендувати» визначає її близько $4 200 на місяць витрат на API — і сам розрив між оцінками є уроком: універсальної точки беззбитковості не існує. Увесь розрахунок залежить від завантаження. GPU, що обслуговує стабільний трафік цілодобово, розподіляє свою фіксовану вартість на мільярди токенів. Той самий GPU, що обслуговує піковий денний трафік, простоює всю ніч, амортизуючись без жодної віддачі, і години простою тихо подвоюють або потроюють вашу справжню вартість за токен.

Перш ніж довіряти чиїйсь цифрі беззбитковості, включно з цифрою з цієї статті, виміряйте характер власного трафіку: стабільні токени за секунду, співвідношення піку до середнього та нахил зростання. Рівний, передбачуваний, зростаючий обсяг сприяє самостійному розміщенню. Піковий або низький обсяг сприяє API з його нульовою вартістю простою.

Чому vLLM зсунув межу​

Обраний вами стек обслуговування — це фінансова змінна, а не просто технічна. Пропускна здатність на GPU визначає, скільки GPU вам потрібно купити, а розрив між наївним циклом обслуговування та сучасним рушієм інференсу — величезний.

vLLM став стандартним вибором для продакшену завдяки двом технікам, які вмикаються з коробки:

  • Безперервне пакетування (continuous batching) тримає кожен слот GPU заповненим, змішуючи нові та поточні запити замість очікування завершення цілого пакета, підвищуючи пропускну здатність приблизно у 2–3 рази порівняно зі статичним пакетуванням.
  • PagedAttention керує кешем ключів-значень блоками, а не через попереднє виділення неперервної пам'яті, зменшуючи втрати на фрагментацію та підтримуючи у 2–4 рази більше одночасних запитів на тій самій карті.

У поєднанні з тензорним паралелізмом між GPU та підтримкою квантованих ваг vLLM забезпечує пропускну здатність порядку 24x порівняно з наївним циклом обслуговування на transformers — а це означає приблизно у 24 рази менше GPU для купівлі за того самого трафіку. Кластер, спроєктований без цих технік, не просто повільніший; це помилка в капітальних видатках.

Для бізнес-обґрунтування важливі ще дві властивості. По-перше, vLLM надає ендпоїнти, сумісні з OpenAI, тож міграція основного трафіку з API — це переважно зміна URL і ключа, а не переписування — витрати на перехід залишаються низькими. По-друге, обмеження: самостійно можна розміщувати лише моделі з відкритими вагами, як-от Llama, Qwen, DeepSeek та Mistral. Передові моделі від великих лабораторій залишаються доступними лише через API, і саме тому типовий кінцевий стан — гібрид: самостійно розміщувати відкриту модель для 80 відсотків рутинного трафіку й далі спрямовувати 20 відсотків, які потребують передового міркування, через API.

Що змінюється у вашій звітності, коли ви переходите на власне розміщення​

Того дня, коли прибувають сервери GPU, ваш бухгалтерський облік змінюється у п'яти місцях. Зробіть це правильно — і математика беззбитковості, яку ви порахували, справді відобразиться у вашій фінансовій звітності.

1. Обладнання стає основним засобом​

Придбані сервери GPU — це капітальні активи, а не витратні матеріали. Ви записуєте ціну придбання плюс прямі витрати на введення кластера в експлуатацію — перевезення, монтаж у стійці, початкову працю з налаштування — як основний засіб на балансі, а потім амортизуєте його. Комп'ютери та пов'язане обладнання зазвичай належать до 5-річного майна MACRS, і амортизація починається, коли актив введено в експлуатацію (готовий і доступний для передбаченого використання), а не коли ви оплачуєте рахунок.

Правило de minimis у $2 500, яке дозволяє списувати дрібні покупки у видатки, не покриє сервер GPU. Не проводьте кластер вартістю $60 000 через канцелярські товари.

2. У 2026 році ви отримуєте справжній вибір щодо податкового таймінгу​

Для федеральних податків чинне законодавство дає вам три швидкості для того самого обладнання:

  • Витрати за статтею 179 (Section 179): відрахування до $2 560 000 кваліфікованого обладнання, введеного в експлуатацію у 2026 році, з пільгою, що поступово зменшується долар за доларом, коли загальні кваліфіковані покупки перевищують $4 090 000. Відрахування не може перевищувати ваш оподатковуваний дохід від бізнесу, але невикористані суми переносяться на майбутнє.
  • 100-відсоткова бонусна амортизація: остаточно відновлена для кваліфікованого майна, придбаного після 19 січня 2025 року. На відміну від статті 179, вона може створити збиток і не має доларового обмеження.
  • Звичайна MACRS: розподіл відрахування на 5 років.

Прибутковий малий бізнес, що купує свій перший кластер, часто списує все у першому році. Стартап без прибутку може надати перевагу MACRS, зберігаючи відрахування на роки, коли буде дохід для заліку. У будь-якому разі відстежуйте балансову та податкову амортизацію окремо — ваша фінансова звітність має відображати економічну реальність протягом строку корисної експлуатації активу, навіть якщо податкова декларація бере все одразу.

3. Орендовані GPU залишаються операційними витратами​

Ніщо з наведеного вище не застосовується, якщо ви орендуєте хмарні GPU погодинно. Погодинна оренда, зарезервовані інстанси та підписки на GPU-хмару — це операційні витрати періоду, ближчі до шляху через API, ніж до володіння. Це законний компромісний варіант (без авансового капіталу, але з вимірюванням), однак не очікуйте від орендного рахунку ані активу на балансі, ані амортизаційного відрахування. Рішення CapEx проти OpEx і рішення «побудувати проти купити» — це дві окремі осі.

4. Поточні витрати кластера поділяються між COGS та OpEx​

Після запуску класифікуйте витрати за тим, що вони підтримують:

  • До COGS (вони масштабуються разом з обслуговуванням клієнтів): електроенергія для продакшн-вузлів, колокація та пропускна здатність для кластера обслуговування, моніторинг і логування для продакшену та амортизація продакшн-GPU.
  • До операційних витрат: прототипна машина, на якій експериментують ваші інженери, staging-середовища та загальна інфраструктура R&D.

Той самий поділ застосовується до праці. Інженерний час, витрачений на підтримку продакшн-інференсу, підтримує надання послуг і може належати до COGS; час, витрачений на оцінку моделі наступного кварталу, — це R&D. Валову маржу SaaS зазвичай орієнтують на рівні 70–85 відсотків, і неправильна класифікація в будь-який бік робить вашу маржу непорівнянною — віднесіть витрати на API та хостинг до накладних, і ваша маржа виглядатиме штучно чудово, тоді як ваші OpEx виглядатимуть роздутими.

5. Ваша валова маржа має зростати після точки беззбитковості​

Відстежуйте цю тотожність щомісяця після міграції: рядок API в COGS має прямувати до нуля (або до 20-відсоткового залишку передових моделей у гібридній схемі), замінюючись меншою сукупною цифрою амортизації плюс хостингу. Якщо валова маржа не покращується протягом кварталу-двох стабільної роботи, то або завантаження нижче за модельоване, або приховані операційні витрати з'їли економію — і це сигнал переглянути рішення, а не захищати його.

У текстовому реєстрі сама покупка — це один збалансований запис — обмін активу з грошових коштів на обладнання, з проводками амортизації, що визнають витрати місяць за місяцем. Якщо ви ніколи не моделювали основні засоби в такий спосіб, документація Beancount покроково розбирає рахунки, проведення амортизації та звіти.

Помилки, що знищують економію​

Більшість невдалих міграцій на власне розміщення провалюються не на бенчмарках GPU. Вони провалюються на витратах, які електронна таблиця пропустила:

Розрахунок на пік, оплата за середнє. Кластер, розрахований на найзавантаженішу годину, решту дня працює наполовину порожнім. Кожна година простою — це амортизація без жодного токена. Автомасштабування допомагає на орендованих GPU; на власному обладнанні єдине виправлення — достатній базовий обсяг.

Забуття про операційний хвіст. Один детальний розбір визначає приховані щомісячні витрати у $4 700 – $7 900 понад вартість обладнання для скромної конфігурації на 4 GPU: 8–20 інженерних годин на місяць ($2 500 – $5 000 за повної вартості зарплат), електроенергія ($400 – $600), мережа й сховище, моніторинг та резервний запасний компонент. Ніщо з цього не з'являється у порівнянні цін на GPU.

Ігнорування розриву в безвідмовності. Постачальники API зазвичай гарантують SLA на рівні 99,9 відсотка безвідмовної роботи. Кластер під власним управлінням без серйозних інвестицій у резервування реально досягає 95–99 відсотків — збійні карти, аварії через нестачу пам'яті, оновлення драйвера CUDA, що ламає розгортання о 2 годині ночі. На $100 000 на місяць доходу, керованого ШІ, один додатковий відсоток простою коштує $1 000 на місяць, ще до врахування реагування на інцидент.

Віднесення витрат на API до накладних. Якщо витрати на інференс сидять у загальних витратах, а не в COGS, ваша валова маржа — це вигадка в обидва боки: завищена до міграції, і покращення після міграції залишається невидимим. Виправте класифікацію перед порівнянням.

Оптимізм щодо строку корисної експлуатації. Деякі гіперскейлери амортизують GPU протягом 5–6 років, тоді як аналітики стверджують, що економічний строк ближчий до 2–3 років, зважаючи на те, як швидко кожне покоління знецінює попереднє. Якщо залишкова вартість вашого кластера обвалюється з виходом наступної архітектури, визнайте знецінення, а не тримайте фантазійний актив.

Змішування витрат на прототипи з продакшеном. GPU, куплений для оцінки донавчання, — це R&D. Кластер, що обслуговує клієнтський трафік, — це продакшен. Змішування їх в одному рахунку спотворює і вашу валову маржу, і обґрунтування вашого податкового кредиту на R&D.

Контрольний список рішень перед покупкою​

Пройдіться цими шістьма питаннями з реальними цифрами, а не з відчуттями:

  1. Обсяг: чи перевищують стабільні місячні витрати на API приблизно $20 000, чи вони впевнено прямують туди протягом двох кварталів?
  2. Який API ви замінюєте? Ціни передових моделей виходять на беззбитковість близько мільярда токенів на місяць; бюджетні ціни API можуть не вийти на беззбитковість ніколи.
  3. Характер трафіку: чи достатньо рівне навантаження, щоб GPU залишалися зайнятими, чи пікове резервування потужностей залишить їх простоювати?
  4. Експертиза: чи хтось у команді вже володіє CUDA, квантуванням і налаштуванням vLLM — чи ви закладаєте найм у розрахунок окупності?
  5. Гроші та податки: чи можете ви профінансувати початковий капітал, і чи маєте дохід, щоб використати відрахування за статтею 179 або бонусну амортизацію — чи MACRS підійшов би вам краще?
  6. Нефінансові чинники: чи вимоги до приватності, відповідності або затримки менше 100 мс змушують до власного розміщення незалежно від витрат?

Три або більше слабких відповіді означають, що поки варто залишитися на API (або на гібридному поділі). Межа все ще буде там, коли ваш обсяг до неї доросте — а на той час наступне покоління GPU зсуне її на вашу користь.

Тримайте витрати на інференс прозорими​

Платите ви за токен чи за графіком амортизації, інференс тепер є однією з ваших найбільших статей витрат, і він заслуговує на краще, ніж одна загадкова підсумкова цифра у звіті про прибутки та збитки. Відокремлення витрат на API від хостингу, продакшн-GPU від прототипних машин і балансової амортизації від податкової — це те, що перетворює точку беззбитковості з одноразового розрахунку на число, за яким ви можете стежити щомісяця.

Beancount.io пропонує текстову бухгалтерію, яка дає вам повну прозорість і контроль над вашими фінансовими даними — жодних чорних скриньок, жодної прив'язки до постачальника. Відстежуйте кластер як основний засіб, проводьте амортизацію за графіком і спостерігайте, як вона проходить через ваші звіти у Fava. Почніть безкоштовно і тримайте витрати на вашу ШІ-інфраструктуру такими ж прозорими, як ваш інфраструктурний код.

Джерело: https://beancount.io/uk/blog/2026/10/10/gpu-breakeven-line-self-hosted-vllm-vs-llm-api-cogs-guide

Опубліковано: 10 жовтня 2026 р.

8 хв. читання

Графіки амортизації GPU, пояснення: Як одна оцінка перетворює 60% маржу на збиток у $1 мільярд

CoreWeave зафіксувала $5,13 млрд доходу та приблизно 60% скориговану маржу…

depreciation
fixed-assets
9 хв. читання

Витрати на LLM API — це собівартість, а не накладні витрати: посібник із валової маржі для AI-обгорток

Інференс LLM — це змінна вартість надання вашого продукту, а не накладні…

cost-of-goods-sold
ai
11 хв. читання

Здаєте свій GPU в оренду на Vast.ai чи RunPod? Чому рахунок за електроенергію та графік амортизації належать до Schedule C, а не до вашого особистого комунального рахунку

Дохід від оренди GPU — це бізнес-дохід за Schedule C: відраховуйте виміряну…

side-hustle
tax-deductions
7 хв. читання

Пояснення рекуперації амортизації: податковий рахунок, який чекає на вас при продажу амортизованого обладнання або нерухомості

Рекуперація амортизації оподатковує відрахування, які ви вже зробили, коли…

depreciation
fixed-assets
11 хв. читання

Відмовляєтеся від хмари на користь койко-місця в колокації? Це змінює графік амортизації, а не лише щомісячний рахунок

Перехід із хмари на койко-місце в колокації перетворює операційні витрати на…

depreciation
fixed-assets