Preskočiť na hlavný obsah

Hranica rentability GPU: Kedy self-hostovaný vLLM cluster prekoná účet za LLM API

Publikované 12 min čítaniaMike ThriftMike Thrift
Hranica rentability GPU: Kedy self-hostovaný vLLM cluster prekoná účet za LLM API
Na tejto stránke

Váš účet za API rastie v dokonalej synchronizácii s vaším úspechom. Každý nový zákazník pridáva tokeny, každý token pridáva náklady a celá suma sa každý mesiac objaví vo vašich nákladoch na predaný tovar. Pri určitom objeme tento meraný účet prekročí hranicu: kúpiť GPU priamo a prevádzkovať inferenciu sám sa stane lacnejším než prenajímať si cudzie. Otázka je, kde sa táto hranica nachádza pre vás — pretože jej prekročenie nie je len inžinierske rozhodnutie. Prepisuje vašu súvahu, vašu hrubú maržu a vaše daňové priznanie.

Tento sprievodca prechádza matematikou rentability, vysvetľuje, prečo vLLM stack posunul hranicu, a čo sa zmení vo vašich knihách v deň, keď prestanete účtovať volania API do nákladov a začnete kapitalizovať GPU cluster.

Dva spôsoby, ako platiť za inferenciu​

Každý token, ktorý váš produkt obslúži, je zaplatený jedným z dvoch spôsobov, a tie zasahujú vaše financie úplne odlišne.

Cesta API je čistý prevádzkový náklad. Platíte za milión tokenov, účet škáluje s používaním a celá suma je náklad obdobia — najprirodzenejšie zaúčtovaný ako náklady na predaný tovar, keďže inferencia je priamo spojená s dodávaním vášho produktu zákazníkom. Nulová záloha, nulové aktíva, nulové odpisy. Vaša hrubá marža utrpí zásah každý mesiac konštantnou rýchlosťou bez ohľadu na to, akí veľkí sa stanete.

Cesta self-hostingu je prevažne kapitálový výdavok. Kúpite GPU servery (alebo podpíšete dlhodobú rezerváciu), umiestnite fixné aktívum na súvahu a odpisujete ho počas jeho životnosti. Vaše mesačné P&L potom namiesto účtu za tokeny zobrazuje odpisy plus prevádzkové náklady — elektrinu, kolokáciu alebo rackový priestor, monitoring a inžinierske hodiny, ktoré udržujú cluster v zdraví.

Tento štrukturálny rozdiel je celá hra. Náklady na API škálujú lineárne s objemom navždy. Náklady na self-hosting sú vopred vynaložené a prevažne fixné, takže efektívne náklady na token klesajú s rastúcim využitím. Niekde sa tieto dve krivky pretnú. Všetko nižšie je o nájdení toho miesta.

Matematika rentability​

Široko citovaná analýza z roku 2026 viac ako 50 produkčných nasadení stanovila pravidlo približne na 20 000 $ mesačne vo výdavkoch na API. Pod touto hranicou inžinierske a prevádzkové náklady na prevádzku vlastného clusteru takmer vždy prevyšujú úspory. Nad 50 000 $ mesačne self-hosting väčšiny prevádzky zvyčajne vyhráva o 50 až 70 percent. Medzi týmito hranicami sa nachádza šedá zóna, kde rozhodujú detaily — vaše modely, charakter vašej prevádzky, skúsenosti vášho tímu s GPU.

Rovnaká analýza načrtla investíciu za týmito číslami: 50 000 až 500 000 $ vopred za GPU hardvér v závislosti od veľkosti modelu, plus 3 000 až 15 000 $ mesačne na priebežnú prevádzku. To sa pohybuje od jedného použitého boxu triedy A100 obsluhujúceho model so 70 miliardami parametrov až po multi-node H100 cluster.

Je enormne dôležité, ktoré API nahrádzate​

Objem rentability sa posúva približne 100-násobne v závislosti od toho, koľko dnes platíte za token:

Mesačný objemNáklady na frontier API (približne)Náklady na self-hosting (vlastný hardvér)Mesačné úspory
100M tokenov1 750 $5 500 $-3 750 $ (strata)
500M tokenov8 750 $7 500 $1 250 $ (20-mesačná návratnosť)
1B tokenov17 500 $10 000 $7 500 $ (7-mesačná návratnosť)
5B tokenov87 500 $25 000 $62 500 $ (1-mesačná návratnosť)

Voči prémiovému frontier API účtujúcemu rádovo 1 750 $ za 100 miliónov tokenov sa priesečník nachádza okolo pol miliardy až miliardy tokenov mesačne a návratnosť sa odtiaľ prudko zrýchľuje.

Ale nahraďte rozpočtové API účtujúce bližšie k 80 $ za 100 miliónov tokenov a matematika sa obráti: potrebovali by ste viac ako 50 miliárd tokenov mesačne, aby ste dosiahli rentabilitu — objem, ktorý si vyžaduje seriózny multi-GPU cluster a vyhradený infraštruktúrny tím. Ak lacné API spĺňa vašu kvalitatívnu latku, self-hosting zriedka dáva finančný zmysel pri akomkoľvek objeme, ktorý malý podnik dosiahne.

Využitie je všetko​

Iné rozbory nákladov stanovujú hranicu rentability oveľa nižšie — jeden detailný model build-vs-rent ju umiestňuje na približne 4 200 $ mesačne vo výdavkoch na API — a rozdiel medzi odhadmi je sám o sebe lekciou: neexistuje univerzálny bod rentability. Celý výpočet závisí od využitia. GPU obsluhujúca stabilnú prevádzku nepretržite rozloží svoj fixný náklad na miliardy tokenov. Tá istá GPU obsluhujúca špičkovú dennú prevádzku sedí celú noc nečinne, odpisuje sa bez výsledku a nečinné hodiny potichu zdvojnásobia alebo strojnásobia vaše skutočné náklady na token.

Predtým než uveríte niekoho číslu rentability, vrátane tohto z článku, zmerajte charakter svojej vlastnej prevádzky: udržateľné tokeny za sekundu, pomer špičky k priemeru a sklon rastu. Rovnomerný, predvídateľný, rastúci objem favorizuje self-hosting. Špičkový alebo nízky objem favorizuje nulové náklady na nečinnosť API.

Prečo vLLM posunul hranicu​

Serving stack, ktorý si vyberiete, je finančná premenná, nielen technická. Priepustnosť na GPU rozhoduje o tom, koľko GPU musíte kúpiť, a rozdiel medzi naivnou serving slučkou a moderným inferenčným enginom je enormný.

vLLM sa stal predvolenou produkčnou voľbou vďaka dvom technikám, ktoré sú zapnuté hneď po vybalení:

  • Continuous batching udržuje každý GPU slot zaplnený miešaním nových a prebiehajúcich požiadaviek namiesto čakania na dokončenie celej dávky, čím zvyšuje priepustnosť približne 2- až 3-násobne oproti statickému batchingu.
  • PagedAttention spravuje key-value cache v blokoch namiesto vopred alokovanej súvislej pamäte, čím znižuje fragmentáciu a podporuje 2- až 4-násobne viac súbežných požiadaviek na tej istej karte.

V kombinácii s tensor parallelism naprieč GPU a podporou kvantizovaných váh poskytuje vLLM priepustnosť rádovo 24-násobku naivnej transformers serving slučky — čo znamená približne 24-násobne menej GPU na kúpu pre rovnakú prevádzku. Cluster dimenzovaný bez týchto techník nie je len pomalší; je to chyba v kapitálových výdavkoch.

Pre obchodný prípad sú dôležité ešte dve vlastnosti. Po prvé, vLLM vystavuje endpointy kompatibilné s OpenAI, takže migrácia hromadnej prevádzky z API je prevažne zmena URL a kľúča namiesto prepisu — náklady na prepnutie zostávajú nízke. Po druhé, obmedzenie: self-hostovať môžete len modely s otvorenými váhami, ako Llama, Qwen, DeepSeek a Mistral. Frontier modely od veľkých laboratórií zostávajú len na API, čo je dôvod, prečo je bežným konečným stavom hybrid: self-hostovať otvorený model pre 80 percent rutinnej prevádzky a smerovať 20 percent, ktoré potrebuje frontier uvažovanie, cez API.

Čo sa zmení vo vašich knihách, keď prejdete na self-hosting​

V deň, keď dorazia GPU servery, sa vaše účtovníctvo zmení na piatich miestach. Urobte to správne a matematika rentability, ktorú ste spustili, sa skutočne prejaví vo vašich financiách.

1. Hardvér sa stane fixným aktívom​

Zakúpené GPU servery sú kapitálové aktíva, nie spotrebný materiál. Zaúčtujete kúpnu cenu plus priame náklady na uvedenie clusteru do prevádzky — dopravu, inštaláciu do racku, prácu na počiatočnej konfigurácii — ako fixné aktívum na súvahu a potom ho odpisujete. Počítače a súvisiace zariadenia sú všeobecne 5-ročný MACRS majetok a odpisovanie začína, keď je aktívum uvedené do prevádzky (pripravené a dostupné na zamýšľané použitie), nie keď zaplatíte faktúru.

Bezpečný prístav de minimis 2 500 $, ktorý vám umožňuje účtovať malé nákupy do nákladov, nepokryje GPU server. Nepúšťajte cluster za 60 000 $ cez kancelárske potreby.

2. V roku 2026 získate skutočnú voľbu v načasovaní daní​

Pre federálne dane vám súčasný zákon dáva tri rýchlosti pre ten istý hardvér:

  • Section 179 expensing: odpočet až do 2 560 000 $ kvalifikovaného zariadenia uvedeného do prevádzky v roku 2026, pričom výhoda sa postupne znižuje dolár za dolár, ak celkové kvalifikované nákupy prekročia 4 090 000 $. Odpočet nemôže prekročiť váš zdaniteľný obchodný príjem, ale nevyužité sumy sa prenášajú do ďalších rokov.
  • 100-percentné bonusové odpisy: natrvalo obnovené pre kvalifikovaný majetok nadobudnutý po 19. januári 2025. Na rozdiel od Section 179 môže vytvoriť stratu a nemá dolárový strop.
  • Bežné MACRS: rozloženie odpočtu na 5 rokov.

Ziskový malý podnik kupujúci svoj prvý cluster často zaúčtuje celý do nákladov v prvom roku. Startup pred dosiahnutím zisku môže uprednostniť MACRS, čím si zachová odpočty na roky, keď bude mať príjem na započítanie. V každom prípade sledujte účtovné a daňové odpisy oddelene — vaše finančné výkazy by mali odrážať ekonomickú realitu počas životnosti aktíva, aj keď daňové priznanie ho odpíše naraz.

3. Prenajaté GPU zostávajú prevádzkovým nákladom​

Nič z vyššie uvedeného neplatí, ak si prenajímate cloudové GPU na hodiny. Hodinové prenájmy, rezervované inštancie a GPU cloudové predplatné sú prevádzkové náklady obdobia — bližšie k ceste API než k vlastníctvu. To je legitímny stred (žiadny počiatočný kapitál, stále merané), ale neočakávajte aktívum na súvahe ani odpočet odpisov z účtu za prenájom. Rozhodnutie CapEx vs. OpEx a rozhodnutie build-vs-buy sú dve oddelené osi.

4. Priebežné náklady clusteru sa delia medzi COGS a OpEx​

Po spustení klasifikujte náklady podľa toho, čo podporujú:

  • Do COGS (škálujú s obsluhou zákazníkov): elektrina pre produkčné nody, kolokácia a šírka pásma pre serving cluster, monitoring a logovanie pre produkciu a odpisy produkčných GPU.
  • Do prevádzkových nákladov: prototypový box, na ktorom experimentujú vaši inžinieri, staging prostredia a všeobecná R&D infraštruktúra.

Rovnaké rozdelenie platí pre prácu. Inžiniersky čas strávený udržiavaním produkčnej inferencie podporuje dodávanie a môže patriť do COGS; čas strávený hodnotením modelu na ďalší kvartál je R&D. Hrubé marže SaaS sa zvyčajne benchmarkujú na 70 až 85 percent, a nesprávna klasifikácia v ktoromkoľvek smere robí vašu maržu neporovnateľnou — ak dáte výdavky na API a hosting do režijných nákladov, vaša marža vyzerá umelo skvele, zatiaľ čo vaše OpEx vyzerá nafúknuté.

5. Vaša hrubá marža by sa mala po prekročení rentability rozšíriť​

Sledujte túto identitu mesačne po migrácii: riadok API v COGS by mal klesnúť k nule (alebo k 20-percentnému frontier zvyšku v hybridnom usporiadaní), nahradený menšou kombinovanou sumou odpisov plus hostingu. Ak sa hrubá marža nezlepší do jedného alebo dvoch kvartálov stabilnej prevádzky, buď je využitie nižšie, než sa modelovalo, alebo skryté prevádzkové náklady zjedli úspory — čo je váš signál prehodnotiť rozhodnutie, nie ho obhajovať.

V plain-text ledgeri je samotný nákup jeden vyvážený záznam — výmena aktív z hotovosti na zariadenie, s odpisovými záznamami uznávajúcimi náklad mesiac po mesiaci. Ak ste nikdy takto nemodelovali fixné aktíva, dokumentácia Beancount prechádza účty, odpisové zápisy a reporty krok za krokom.

Chyby, ktoré vymažú úspory​

Väčšina neúspešných migrácií na self-hosting nepadá na GPU benchmarkoch. Padajú na nákladoch, ktoré tabuľka vynechala:

Dimenzovanie na špičku, platenie za priemer. Cluster provisionovaný na vašu najrušnejšiu hodinu beží zvyšok dňa poloprázdny. Každá nečinná hodina je odpis bez tokenov. Autoscaling pomáha pri prenajatých GPU; pri vlastnom hardvéri je jediným riešením dostatočný základný objem.

Zabudnutie na prevádzkový chvost. Jeden detailný rozbor stanovuje skryté mesačné náklady na 4 700 až 7 900 $ navrch k hardvéru pre skromné 4-GPU usporiadanie: 8 až 20 inžinierskych hodín mesačne (2 500 až 5 000 $ pri zaťažených platoch), elektrina (400 až 600 $), sieť a úložisko, monitoring a rezervná záloha pre redundanciu. Nič z toho sa neobjaví v porovnaní cien GPU.

Ignorovanie medzery v dostupnosti. Poskytovatelia API zvyčajne garantujú 99,9-percentnú SLA dostupnosť. Samostatne prevádzkovaný cluster bez serióznych investícií do redundancie realisticky dosiahne 95 až 99 percent — zlyhané karty, pády pri nedostatku pamäte, aktualizácia CUDA ovládača, ktorá o 2:00 ráno rozbije nasadenie. Pri 100 000 $ mesačne príjmov poháňaných AI stojí jeden percentuálny bod dodatočného výpadku 1 000 $ mesačne, pred započítaním reakcie na incident.

Účtovanie výdavkov na API ako režijných nákladov. Ak náklady na inferenciu sedia vo všeobecných výdavkoch namiesto COGS, vaša hrubá marža je fikcia v oboch smeroch: nadhodnotená pred migráciou a zlepšenie po migrácii neviditeľné. Opravte klasifikáciu skôr, než budete porovnávať.

Optimizmus v životnosti. Niektorí hyperscaleri odpisujú GPU počas 5 až 6 rokov, zatiaľ čo analytici argumentujú, že ekonomická životnosť je bližšie k 2 až 3 rokom vzhľadom na to, ako rýchlo každá generácia znehodnocuje predchádzajúcu. Ak sa zostatková hodnota vášho clusteru zrúti, keď príde ďalšia architektúra, zaúčtujte zníženie hodnoty namiesto nesenia fantazijného aktíva.

Miešanie prototypových výdavkov s produkčnými. GPU, ktorú ste kúpili na vyhodnotenie fine-tuningu, je R&D. Cluster obsluhujúci zákaznícku prevádzku je produkcia. Ich miešanie na jednom účte poškodzuje vašu hrubú maržu aj podklady pre R&D kredit.

Kontrolný zoznam rozhodnutia pred kúpou​

Prejdite týchto šesť otázok so skutočnými číslami, nie s pocitmi:

  1. Objem: Sú udržateľné mesačné výdavky na API nad približne 20 000 $, alebo tam vierohodne smerujú do dvoch kvartálov?
  2. Ktoré API nahrádzate? Prémiové frontier ceny dosahujú rentabilitu okolo miliardy tokenov mesačne; rozpočtové ceny API nemusia dosiahnuť rentabilitu nikdy.
  3. Charakter prevádzky: Je zaťaženie dosť rovnomerné, aby GPU zostali zaneprázdnené, alebo dimenzovanie na špičku nechá kapacitu ležať ladom?
  4. Odbornosť: Hovorí už niekto v tíme rečou CUDA, kvantizácie a ladenia vLLM — alebo do matematiky návratnosti rozpočtujete nábor?
  5. Hotovosť a dane: Dokážete financovať počiatočný kapitál a máte príjem na využitie odpočtu Section 179 alebo bonusového odpočtu — alebo by vám lepšie poslúžil MACRS?
  6. Nefinančné faktory: Nútia vás požiadavky na súkromie, compliance alebo latenciu pod 100 ms na self-hosting bez ohľadu na náklady?

Tri alebo viac slabých odpovedí znamená zostať zatiaľ na API (alebo hybridnom rozdelení). Hranica tam bude stále, keď do nej váš objem dorastie — a dovtedy ju ďalšia generácia GPU posunie vo váš prospech.

Udržte svoje výdavky na inferenciu čitateľné​

Či už platíte za token alebo za odpisový plán, inferencia je teraz jednou z vašich najväčších nákladových položiek a zaslúži si lepšie ako jediný záhadný total na P&L. Oddelenie výdavkov na API od hostingu, produkčných GPU od prototypových boxov a účtovných odpisov od daňových je to, čo mení hranicu rentability z jednorazového výpočtu na číslo, ktoré môžete sledovať každý mesiac.

Beancount.io poskytuje plain-text účtovníctvo, ktoré vám dáva úplnú transparentnosť a kontrolu nad vašimi finančnými údajmi — žiadne čierne skrinky, žiadne vendor lock-in. Sledujte cluster ako fixné aktívum, účtujte odpisy podľa plánu a sledujte, ako pretekajú vašimi reportmi vo Fava. Začnite zadarmo a udržte svoje výdavky na AI infraštruktúru tak čitateľné, ako je váš infraštruktúrny kód.

Zdroj: https://beancount.io/sk/blog/2026/10/10/gpu-breakeven-line-self-hosted-vllm-vs-llm-api-cogs-guide

Publikované: 10. októbra 2026