Сметката ви за API расте в перфектен синхрон с успеха ви. Всеки нов клиент добавя токени, всеки токен добавя разход, и цялата сума попада в себестойността на продадените стоки всеки месец. При определен обем тази измервана сметка пресича една линия: закупуването на GPU-та направо и извършването на изводите сами става по-евтино от наемането на чужди. Въпросът е къде се намира тази линия за вас — защото прекрачването ѝ не е просто инженерно решение. То пренаписва баланса ви, брутния ви марж и данъчната ви декларация.
Това ръководство преминава през математиката на рентабилността, защо стекът за обслужване vLLM премести линията и какво се променя в счетоводните ви книги в деня, в който спрете да отчитате API обажданията като текущ разход и започнете да капитализирате GPU клъстер.
Два начина да плащате за изводи
Всеки токен, който продуктът ви обслужва, се заплаща по един от два начина, и те се отразяват на финансите ви по коренно различен начин.
Пътят през API е чист оперативен разход. Плащате на милион токени, сметката се мащабира с използването, и цялата сума е разход за периода — най-естествено осчетоводен като себестойност на продадените стоки, тъй като изводите са пряко свързани с предоставянето на продукта ви на клиентите. Нула първоначални разходи, нула активи, нула амортизация. Брутният ви марж понася удара всеки месец с постоянна ставка, независимо колко голям станете.
Пътят на самостоятелния хостинг е предимно капиталов разход. Купувате GPU сървъри (или подписвате дългосрочна резервация), записвате дълготраен актив в баланса и го амортизирате през полезния му живот. Месечният ви отчет за приходи и разходи тогава показва амортизация плюс оперативни разходи — електричество, колокация или място в стелаж, мониторинг и инженерните часове, които поддържат клъстера здрав — вместо сметка на токен.
Тази структурна разлика е цялата игра. Разходите за API се мащабират линейно с обема завинаги. Разходите за самостоятелен хостинг са изтеглени напред и предимно фиксирани, така че ефективната цена на токен пада с нарастване на използването. Някъде тези две криви се пресичат. Всичко по-долу е за намирането на това място.
Математиката на рентабилността
Широко цитиран анализ от 2026 г. на повече от 50 продукционни внедрявания постави основното правило на около $20 000 на месец разходи за API. Под тази граница инженерните и оперативните разходи за управление на собствен клъстер почти винаги надвишават спестяванията. Над $50 000 на месец самостоятелният хостинг на по-голямата част от трафика обикновено печели с 50 до 70 процента. Между тези линии се намира сива зона, където детайлите — вашите модели, формата на трафика ви, GPU опитът на екипа ви — решават.
Същият анализ скицира инвестицията зад тези числа: $50 000 до $500 000 първоначално за GPU хардуер в зависимост от размера на модела, плюс $3 000 до $15 000 на месец текущи оперативни разходи. Това варира от една употребявана машина от клас A100, обслужваща модел с 70 милиарда параметъра, до многонодов H100 клъстер.
Изключително важно е кой API заменяте
Обемът на рентабилност се измества приблизително 100 пъти в зависимост от това какво плащате на токен днес:
| Месечен обем | Цена на водещ API (прибл.) | Цена на самостоятелен хостинг (собствен хардуер) | Месечни спестявания |
|---|---|---|---|
| 100M токена | $1 750 | $5 500 | -$3 750 (загуба) |
| 500M токена | $8 750 | $7 500 | $1 250 (изплащане за 20 месеца) |
| 1B токена | $17 500 | $10 000 | $7 500 (изплащане за 7 месеца) |
| 5B токена | $87 500 | $25 000 | $62 500 (изплащане за 1 месец) |
Срещу премиум водещ API, таксуващ от порядъка на $1 750 на 100 милиона токена, пресечната точка се намира около половин до един милиард токена на месец, и изплащането се ускорява силно оттам нататък.
Но заменете бюджетен API, таксуващ по-близо до $80 на 100 милиона токена, и математиката се обръща: ще ви трябват 50 милиарда плюс токена на месец, за да излезете на нула — обем, който изисква сериозен мулти-GPU клъстер и специален инфраструктурен екип. Ако евтин API отговаря на качествения ви стандарт, самостоятелният хостинг рядко има финансов смисъл при какъвто и да е обем, който малък бизнес ще достигне.
Използването е всичко
Други разбивки на разходите поставят рентабилността много по-ниско — един подробен модел за изграждане срещу наемане я поставя близо до $4 200 на месец разходи за API — и разликата между оценките сама по себе си е урокът: няма универсална точка на рентабилност. Цялото изчисление зависи от използването. GPU, обслужващ постоянен трафик денонощно, разпределя фиксирания си разход върху милиарди токени. Същият GPU, обслужващ пиков дневен трафик, стои бездействащ цяла нощ, амортизирайки се без нищо насреща, и часовете на бездействие тихо удвояват или утрояват истинската ви цена на токен.
Преди да се доверите на нечие число за рентабилност, включително това в тази статия, измерете собствения си профил на трафика: устойчиви токени в секунда, съотношение пик към средно и наклон на растежа. Равен, предвидим, растящ обем благоприятства самостоятелния хостинг. Пиков или нисък обем благоприятства нулевия разход за бездействие на API.
Защо vLLM премести линията
Стекът за обслужване, който изберете, е финансова променлива, не само техническа. Производителността на GPU решава колко GPU-та трябва да купите, а разликата между наивен цикъл за обслужване и модерен двигател за изводи е огромна.
vLLM се превърна в подразбиращия се производствен избор чрез две техники, които идват включени по подразбиране:
- Непрекъснато групиране (continuous batching) поддържа всеки GPU слот запълнен чрез смесване на нови и текущи заявки, вместо да чака цяла партида да приключи, повишавайки производителността приблизително 2 до 3 пъти спрямо статичното групиране.
- PagedAttention управлява кеша ключ-стойност на блокове, вместо да предварително разпределя непрекъсната памет, намалявайки загубите от фрагментация и поддържайки 2 до 4 пъти повече паралелни заявки на същата карта.
Комбинирани с тензорен паралелизъм върху GPU-та и поддръжка на квантизирани тегла, vLLM осигурява от порядъка на 24 пъти производителността на наивен цикъл за обслужване с transformers — което означава приблизително 24 пъти по-малко GPU-та за закупуване при същия трафик. Клъстер, оразмерен без тези техники, не е просто по-бавен; той е грешка в капиталовите разходи.
Още две свойства имат значение за бизнес случая. Първо, vLLM предоставя крайни точки, съвместими с OpenAI, така че мигрирането на масов трафик от API е до голяма степен промяна на URL и ключ, а не преписване — разходите за преминаване остават ниски. Второ, ограничението: можете да хоствате самостоятелно само модели с отворени тегла като Llama, Qwen, DeepSeek и Mistral. Водещите модели от големите лаборатории остават само през API, поради което обичайното крайно състояние е хибрид: самостоятелен хостинг на отворен модел за 80 процента от трафика, който е рутинен, и запазване на маршрутизирането на 20 процента, които се нуждаят от водещо разсъждение, през API.
Какво се променя в книгите ви, когато преминете към самостоятелен хостинг
В деня, в който GPU сървърите пристигнат, счетоводството ви се променя на пет места. Направете тези неща правилно и математиката за рентабилност, която сте изчислили, действително ще се появи във финансите ви.
1. Хардуерът става дълготраен актив
Закупените GPU сървъри са капиталови активи, не консумативи. Записвате покупната цена плюс преките разходи за въвеждане на клъстера в експлоатация — транспорт, монтаж в стелаж, начален труд по конфигурация — като дълготраен актив в баланса, след което го амортизирате. Компютрите и свързаното оборудване обикновено са 5-годишна MACRS собственост, и амортизацията започва, когато активът е пуснат в експлоатация (готов и наличен за предвидената му употреба), не когато платите фактурата.
Прагът de minimis от $2 500, който ви позволява да отчитате малки покупки като разход, няма да покрие GPU сървър. Не прекарвайте клъстер за $60 000 през офис консумативи.
2. Получавате истински избор за данъчно време през 2026 г.
За федералните данъци действащото законодателство ви дава три скорости за същия хардуер:
- Разход по Секция 179: приспадате до $2 560 000 от отговарящо на условията оборудване, пуснато в експлоатация през 2026 г., като облекчението се премахва постепенно долар за долар, след като общите отговарящи на условията покупки надхвърлят $4 090 000. Приспадането не може да надвишава облагаемия ви бизнес доход, но неизползваните суми се пренасят напред.
- 100 процента бонус амортизация: трайно възстановена за отговаряща на условията собственост, придобита след 19 януари 2025 г. За разлика от Секция 179, тя може да създаде загуба и няма таван в долари.
- Редовна MACRS: разпределяте приспадането върху 5 години.
Печеливш малък бизнес, купуващ първия си клъстер, често ще отчете цялата сума като разход през първата година. Стартъп преди печалба може да предпочете MACRS, запазвайки приспаданията за годините, в които има доход за прихващане. И в двата случая проследявайте счетоводната и данъчната амортизация отделно — финансовите ви отчети трябва да отразяват икономическата реалност през полезния живот на актива, дори когато данъчната декларация го приспада изцяло наведнъж.
3. Наетите GPU-та остават оперативен разход
Нищо от горното не се прилага, ако наемате облачни GPU-та на час. Почасовите наеми, резервираните инстанции и абонаментите за GPU облак са оперативни разходи за периода — по-близо до пътя през API, отколкото до собствеността. Това е легитимна средна позиция (без първоначален капитал, все още измервана), но не очаквайте актив в баланса или приспадане за амортизация от сметка за наем. Решението CapEx срещу OpEx и решението изграждане срещу покупка са две отделни оси.
4. Текущите разходи за клъстера се разделят между COGS и OpEx
Веднъж заработени, класифицирайте разходите по това какво поддържат:
- В COGS (мащабират се с обслужването на клиенти): електричество за производствените възли, колокация и честотна лента за клъстера за обслужване, мониторинг и логване за продукцията, и амортизацията на производствените GPU-та.
- В оперативни разходи: прототипната машина, на която експериментират инженерите ви, средите за тестване и общата R&D инфраструктура.
Същото разделение се прилага за труда. Инженерното време, прекарано в поддържане на производствените изводи, подпомага доставката и може да стои в COGS; времето, прекарано в оценяване на модела за следващото тримесечие, е R&D. Брутните маржове на SaaS обикновено се сравняват на 70 до 85 процента, и погрешното класифициране в която и да е посока прави маржа ви несравним — поставете разходите за API и хостинг в режийни и маржът ви изглежда изкуствено прекрасен, докато OpEx изглежда раздут.
5. Брутният ви марж трябва да се разшири след точката на рентабилност
Наблюдавайте тази идентичност месечно след миграцията: редът за API в COGS трябва да падне към нула (или към 20-процентния водещ остатък при хибридна настройка), заменен от по-малка комбинирана цифра амортизация плюс хостинг. Ако брутният марж не се подобри в рамките на едно-две тримесечия на стабилна работа, или използването е по-ниско от моделираното, или скрити оперативни разходи са изяли спестяванията — което е вашият знак да преразгледате решението, а не да го защитавате.
В счетоводна книга на обикновен текст самата покупка е един балансиран запис — замяна на актив от пари в оборудване, с амортизационни записи, признаващи разхода месец по месец. Ако никога не сте моделирали дълготрайни активи по този начин, документацията на Beancount преминава през сметки, амортизационни осчетоводявания и отчети стъпка по стъпка.
Грешки, които заличават спестяванията
Повечето неуспешни миграции към самостоятелен хостинг не се провалят на GPU бенчмаркове. Те се провалят на разходи, които таблицата е пропуснала:
Оразмеряване за пика, плащане за средното. Клъстер, осигурен за най-натоварения ви час, работи наполовина празен през останалата част от деня. Всеки час на бездействие е амортизация без токени. Автоматичното мащабиране помага при наети GPU-та; при собствен хардуер единственото решение е достатъчен базов обем.
Забравяне на оперативната опашка. Едно подробно разглобяване поставя скритите месечни разходи на $4 700 до $7 900 върху хардуера за скромна 4-GPU конфигурация: 8 до 20 инженерни часа на месец ($2 500 до $5 000 при натоварени заплати), електричество ($400 до $600), мрежа и съхранение, мониторинг и резервен компонент за излишък. Нищо от това не се появява в сравнение на цени на GPU.
Пренебрегване на разликата в работното време. Доставчиците на API обикновено гарантират 99,9 процента SLA работно време. Самостоятелно управляван клъстер без сериозна инвестиция в излишък реалистично достига 95 до 99 процента — отказали карти, сривове от изчерпана памет, актуализация на CUDA драйвер, която чупи внедряването в 2 часа през нощта. При $100 000 на месец приходи, задвижвани от AI, един допълнителен процент престой струва $1 000 на месец, преди да се брои реакцията при инцидент.
Осчетоводяване на разходите за API като режийни. Ако разходите за изводи стоят в общите разходи вместо в COGS, брутният ви марж е фикция в двете посоки: надценен преди миграцията, и подобрението след миграцията невидимо. Поправете класификацията, преди да сравнявате.
Оптимизъм за полезния живот. Някои хиперскалери амортизират GPU-та за 5 до 6 години, докато анализаторите твърдят, че икономическият живот е по-близо до 2 до 3 години предвид колко бързо всяко поколение прави предишното остаряло. Ако стойността за препродажба на клъстера ви се срине, когато излезе следващата архитектура, запишете обезценка, вместо да носите фантастичен актив.
Смесване на разходите за прототипи с производството. GPU, който сте купили, за да оценявате фина настройка, е R&D. Клъстерът, обслужващ клиентски трафик, е производство. Смесването им в една сметка разваля и брутния ви марж, и подкрепата за R&D кредита.
Контролен списък за решение преди да купите
Преминете през тези шест въпроса с реални числа, не с усещания:
- Обем: Устойчивите месечни разходи за API надвишават ли приблизително $20 000, или надеждно се насочват натам в рамките на две тримесечия?
- Кой API заменяте? Премиум водещото ценообразуване излиза на нула близо до милиард токена на месец; бюджетното ценообразуване на API може никога да не излезе на нула.
- Форма на трафика: Достатъчно равен ли е товарът, че GPU-тата да останат заети, или осигуряването за пикове ще остави капацитет неизползван?
- Експертиза: Говори ли някой от екипа вече CUDA, квантизация и настройка на vLLM — или включвате наемане в математиката за изплащане?
- Пари и данъци: Можете ли да финансирате първоначалния капитал, и имате ли доход, за да използвате приспадане по Секция 179 или бонус — или MACRS би ви послужил по-добре?
- Нефинансови двигатели: Принуждават ли ви изисквания за поверителност, съответствие или латентност под 100ms към самостоятелен хостинг независимо от разходите?
Три или повече слаби отговора означават да останете на API (или хибридното разделение) засега. Линията ще бъде там и когато обемът ви нарасне до нея — и дотогава следващото поколение GPU ще я е преместило в ваша полза.
Пазете разходите си за изводи четими
Независимо дали плащате на токен или на амортизационен график, изводите сега са една от най-големите ви разходни линии, и заслужават нещо по-добро от една мистериозна обща сума в отчета за приходи и разходи. Разделянето на разходите за API от хостинга, на производствените GPU-та от прототипните машини, и на счетоводната амортизация от данъчната амортизация е това, което превръща точката на рентабилност от еднократно изчисление в число, което можете да наблюдавате всеки месец.
Beancount.io предоставя счетоводство на обикновен текст, което ви дава пълна прозрачност и контрол върху финансовите ви данни — без черни кутии, без обвързване с доставчик. Проследявайте клъстера като дълготраен актив, осчетоводявайте амортизацията по график и я наблюдавайте как преминава през отчетите ви във Fava. Започнете безплатно и поддържайте разходите си за AI инфраструктура толкова четими, колкото е инфраструктурният ви код.





