Salta al contingut principal

La línia d'equilibri de la GPU: quan un clúster vLLM autoallotjat supera la factura de l'API d'LLM

Publicat 15 minuts de lecturaMike ThriftMike Thrift
La línia d'equilibri de la GPU: quan un clúster vLLM autoallotjat supera la factura de l'API d'LLM
En aquesta pàgina

La teva factura d'API creix en perfecta sincronia amb el teu èxit. Cada client nou afegeix tokens, cada token afegeix cost, i la totalitat de l'import va a parar al teu cost de béns venuts cada mes. A un cert volum, aquesta factura mesurada creua una línia: comprar les GPU directament i executar la inferència tu mateix esdevé més barat que llogar les d'algú altre. La qüestió és on es troba aquesta línia en el teu cas — perquè creuar-la no és només una decisió d'enginyeria. Reescriu el teu balanç, el teu marge brut i la teva declaració d'impostos.

Aquesta guia recorre els càlculs del punt d'equilibri, per què la pila de servei vLLM va desplaçar la línia, i què canvia als teus llibres el dia que deixes de comptabilitzar les crides a l'API com a despesa i comences a capitalitzar un clúster de GPU.

Dues maneres de pagar la inferència​

Cada token que serveix el teu producte es paga d'una de dues maneres, i impacten els teus estats financers de manera completament diferent.

La via de l'API és despesa operativa pura. Pagues per milió de tokens, la factura escala amb l'ús, i l'import total és un cost del període — el més natural és comptabilitzar-lo com a cost de béns venuts, ja que la inferència està directament lligada a lliurar el teu producte als clients. Zero desemborsament inicial, zero actius, zero depreciació. El teu marge brut rep l'impacte cada mes a un ritme constant, independentment de com de gran et facis.

La via de l'autoallotjament és majoritàriament despesa de capital. Compreu servidors de GPU (o signeu una reserva a llarg termini), poseu un actiu fix al balanç, i el deprecieu al llarg de la seva vida útil. El vostre compte de pèrdues i guanys mensual mostra llavors la depreciació més els costos operatius — electricitat, col·locació o espai en rack, monitoratge, i les hores d'enginyeria que mantenen el clúster saludable — en lloc d'una factura per token.

Aquesta diferència estructural ho és tot. Els costos de l'API escalen linealment amb el volum per sempre. Els costos d'autoallotjament estan carregats al davant i són majoritàriament fixos, de manera que el cost efectiu per token cau a mesura que puja la utilització. En algun punt aquestes dues corbes es creuen. Tot el que segueix tracta de trobar on.

Els càlculs del punt d'equilibri​

Una anàlisi àmpliament citada de 2026 sobre més de 50 desplegaments en producció situava la regla general en aproximadament 20.000 $ al mes de despesa en API. Per sota d'això, el cost d'enginyeria i operacions de gestionar el teu propi clúster gairebé sempre supera l'estalvi. Per sobre de 50.000 $ al mes, l'autoallotjament de la major part del trànsit normalment guanya per un 50 a 70 per cent. Entre aquestes línies hi ha una zona grisa on els detalls — els teus models, la forma del teu trànsit, l'experiència en GPU del teu equip — decideixen.

La mateixa anàlisi esbossava la inversió darrere d'aquests números: 50.000 $ a 500.000 $ de desemborsament inicial per maquinari de GPU segons la mida del model, més 3.000 $ a 15.000 $ al mes en operacions contínues. Això va des d'una única caixa de classe A100 d'ocasió que serveix un model de 70.000 milions de paràmetres fins a un clúster multi-node d'H100.

Importa enormement quina API estàs substituint​

El volum de punt d'equilibri es desplaça aproximadament 100 vegades segons el que pagues per token avui:

Volum mensualCost de l'API frontera (aprox.)Cost autoallotjat (maquinari propi)Estalvi mensual
100M tokens1.750 $5.500 $-3.750 $ (pèrdua)
500M tokens8.750 $7.500 $1.250 $ (retorn en 20 mesos)
1B tokens17.500 $10.000 $7.500 $ (retorn en 7 mesos)
5B tokens87.500 $25.000 $62.500 $ (retorn en 1 mes)

Davant d'una API frontera premium que cobra de l'ordre de 1.750 $ per cada 100 milions de tokens, el creuament se situa al voltant de mig mil milions a mil milions de tokens al mes, i el retorn s'accelera fortament a partir d'aquí.

Però substituir una API econòmica que cobra més a prop de 80 $ per cada 100 milions de tokens inverteix els càlculs: necessitaries més de 50.000 milions de tokens al mes per arribar al punt d'equilibri — un volum que exigeix un clúster multi-GPU seriós i un equip d'infraestructura dedicat. Si una API barata compleix el teu llindar de qualitat, l'autoallotjament rarament té sentit financer a qualsevol volum que una petita empresa arribi a assolir.

La utilització ho és tot​

Altres desglossaments de costos situen el punt d'equilibri molt més baix — un model detallat de construir vs. llogar el situa prop de 4.200 $ al mes de despesa en API — i la diferència entre estimacions és ella mateixa la lliçó: no hi ha un punt d'equilibri universal. Tot el càlcul depèn de la utilització. Una GPU que serveix trànsit constant les 24 hores reparteix el seu cost fix entre milers de milions de tokens. La mateixa GPU que serveix trànsit diürn irregular està inactiva tota la nit, depreciant-se sense res a canvi, i les hores d'inactivitat dupliquen o tripliquen silenciosament el teu cost real per token.

Abans de confiar en la xifra de punt d'equilibri de qualsevol, incloent-hi la d'aquest article, mesura la forma del teu propi trànsit: tokens per segon sostinguts, ràtio pic-mitjana, i pendent de creixement. Un volum pla, predictible i creixent afavoreix l'autoallotjament. Un volum irregular o baix afavoreix el cost zero d'inactivitat de l'API.

Per què vLLM va desplaçar la línia​

La pila de servei que tries és una variable financera, no només tècnica. El rendiment per GPU decideix quantes GPU has de comprar, i la diferència entre un bucle de servei ingenu i un motor d'inferència modern és enorme.

vLLM s'ha convertit en l'opció de producció per defecte gràcies a dues tècniques que s'inclouen activades de sèrie:

  • El batching continu manté cada ranura de GPU plena barrejant sol·licituds noves i en curs en lloc d'esperar que acabi tot un lot, elevant el rendiment aproximadament 2 a 3 vegades per sobre del batching estàtic.
  • PagedAttention gestiona la memòria cau de clau-valor en blocs en lloc de preassignar memòria contígua, reduint el malbaratament per fragmentació i admetent 2 a 4 vegades més sol·licituds concurrents a la mateixa targeta.

Combinat amb el paral·lelisme tensorial entre GPU i el suport per a pesos quantitzats, vLLM lliura de l'ordre de 24 vegades el rendiment d'un bucle de servei ingenu de transformers — cosa que significa aproximadament 24 vegades menys GPU a comprar pel mateix trànsit. Un clúster dimensionat sense aquestes tècniques no només és més lent; és un error de despesa de capital.

Dues propietats més importen per al cas de negoci. Primer, vLLM exposa endpoints compatibles amb OpenAI, de manera que migrar el trànsit massiu fora d'una API és en gran part un canvi d'URL i de clau en lloc d'una reescriptura — el cost de canvi es manté baix. Segon, la restricció: només pots autoallotjar models de pesos oberts com Llama, Qwen, DeepSeek i Mistral. Els models frontera dels grans laboratoris romanen exclusius d'API, i és per això que l'estat final habitual és un híbrid: autoallotjar un model obert pel 80 per cent del trànsit que és rutinari, i continuar encaminant el 20 per cent que necessita raonament frontera a través d'una API.

Què canvia als teus llibres quan t'autoallotges​

El dia que arriben els servidors de GPU, la teva comptabilitat canvia en cinc llocs. Fes-ho bé i els càlculs del punt d'equilibri que vas fer es reflectiran realment als teus estats financers.

1. El maquinari es converteix en un actiu fix​

Els servidors de GPU comprats són actius de capital, no subministraments. Enregistres el preu de compra més els costos directes de posar el clúster en servei — transport, instal·lació en rack, mà d'obra de configuració inicial — com un actiu fix al balanç, i després el deprecies. Els ordinadors i equips relacionats generalment són propietat MACRS a 5 anys, i la depreciació comença quan l'actiu es posa en servei (llest i disponible per al seu ús previst), no quan pagues la factura.

El port segur de minimis de 2.500 $ que et permet comptabilitzar com a despesa les compres petites no cobrirà un servidor de GPU. No facis passar un clúster de 60.000 $ per material d'oficina.

2. Tens una autèntica elecció de temporització fiscal el 2026​

Per als impostos federals, la llei actual et dona tres velocitats per al mateix maquinari:

  • Amortització de la Secció 179: dedueix fins a 2.560.000 $ d'equip qualificat posat en servei el 2026, amb el benefici reduint-se dòlar per dòlar un cop les compres qualificades totals superen 4.090.000 $. La deducció no pot superar el teu benefici empresarial imposable, però els imports no utilitzats es poden arrossegar.
  • Depreciació accelerada del 100 per cent: restaurada permanentment per a propietats qualificades adquirides després del 19 de gener de 2025. A diferència de la Secció 179, pot crear una pèrdua i no té límit en dòlars.
  • MACRS regular: reparteix la deducció al llarg de 5 anys.

Una petita empresa rendible que compra el seu primer clúster sovint el comptabilitzarà com a despesa tot en el primer any. Una startup encara no rendible pot preferir MACRS, preservant les deduccions per als anys en què hi hagi ingressos per compensar. En qualsevol cas, fes un seguiment separat de la depreciació comptable i la fiscal — els teus estats financers haurien de reflectir la realitat econòmica al llarg de la vida útil de l'actiu fins i tot quan la declaració d'impostos se l'emporta tota d'una vegada.

3. Les GPU llogades segueixen sent despesa operativa​

Res de l'anterior s'aplica si llogues GPU al núvol per hores. Els lloguers per hores, les instàncies reservades i les subscripcions al núvol de GPU són costos operatius del període — més a prop de la via de l'API que de la propietat. És un terme mitjà legítim (sense capital inicial, encara mesurat), però no esperis un actiu al balanç ni una deducció per depreciació d'una factura de lloguer. La decisió CapEx vs. OpEx i la decisió de construir vs. comprar són dos eixos separats.

4. Els costos continus del clúster es reparteixen entre COGS i OpEx​

Un cop en funcionament, classifica els costos pel que donen suport:

  • A COGS (escalen amb el servei als clients): electricitat per als nodes de producció, col·locació i amplada de banda pel clúster de servei, monitoratge i registre per a la producció, i la depreciació de les GPU de producció.
  • A despesa operativa: la caixa de prototip en què experimenten els teus enginyers, els entorns d'staging, i la infraestructura general d'R+D.

La mateixa divisió s'aplica a la mà d'obra. El temps d'enginyeria dedicat a mantenir en funcionament la inferència de producció dona suport al lliurament i pot situar-se a COGS; el temps dedicat a avaluar el model del proper trimestre és R+D. Els marges bruts de SaaS es prenen normalment com a referència entre el 70 i el 85 per cent, i classificar malament en qualsevol direcció fa que el teu marge no sigui comparable — posa la despesa d'API i allotjament a despeses generals i el teu marge semblarà artificialment meravellós mentre el teu OpEx semblarà inflat.

5. El teu marge brut hauria d'expandir-se més enllà del punt d'equilibri​

Vigila aquesta identitat mensualment després de la migració: la línia d'API a COGS hauria de caure cap a zero (o cap al romanent frontera del 20 per cent en una configuració híbrida), substituïda per una xifra combinada més petita de depreciació més allotjament. Si el marge brut no millora dins d'un trimestre o dos d'operació en estat estacionari, o bé la utilització és més baixa del que es va modelar o els costos operatius ocults es van menjar l'estalvi — cosa que és el teu senyal per revisar la decisió en lloc de defensar-la.

En un llibre de text pla, la compra en si és un sol apunt equilibrat — un intercanvi d'actius d'efectiu a equip, amb apunts de depreciació que reconeixen el cost mes a mes. Si mai has modelat actius fixos d'aquesta manera, la documentació de Beancount recorre comptes, registres de depreciació i informes pas a pas.

Errors que esborren l'estalvi​

La majoria de migracions d'autoallotjament fallides no fallen en els benchmarks de GPU. Falleixen en costos que el full de càlcul va ometre:

Dimensionar per al pic, pagar per la mitjana. Un clúster aprovisionat per a la teva hora més ocupada funciona mig buit la resta del dia. Cada hora d'inactivitat és depreciació sense tokens. L'escalat automàtic ajuda en GPU llogades; en maquinari propi, l'única solució és suficient volum de base.

Oblidar la cua d'operacions. Un desglossament detallat situa els costos mensuals ocults en 4.700 $ a 7.900 $ a més del maquinari per a una configuració modesta de 4 GPU: 8 a 20 hores d'enginyeria al mes (2.500 $ a 5.000 $ amb salaris carregats), electricitat (400 $ a 600 $), xarxa i emmagatzematge, monitoratge, i un recanvi de redundància. Res d'això apareix en una comparació de preus de GPU.

Ignorar la bretxa de disponibilitat. Els proveïdors d'API normalment garanteixen un 99,9 per cent de disponibilitat per SLA. Un clúster autogestionat sense una inversió seriosa en redundància arriba realísticament al 95 a 99 per cent — targetes fallides, caigudes per falta de memòria, una actualització del controlador CUDA que trenca el desplegament a les 2 de la matinada. Amb 100.000 $ al mes d'ingressos impulsats per IA, un punt extra d'inactivitat costa 1.000 $ al mes, abans de comptar la resposta a incidents.

Comptabilitzar la despesa d'API com a despeses generals. Si els costos d'inferència se situen a despeses generals en lloc de COGS, el teu marge brut és ficció en ambdues direccions: sobreestimat abans de la migració, i la millora posterior a la migració invisible. Corregeix la classificació abans de comparar.

Optimisme sobre la vida útil. Alguns hiperescaladors deprecen les GPU al llarg de 5 a 6 anys mentre els analistes argumenten que la vida econòmica és més propera a 2 o 3 anys, atès com de ràpid cada generació deixa obsoleta l'anterior. Si el valor de revenda del teu clúster s'enfonsa quan surt la propera arquitectura, enregistra un deteriorament en lloc de carregar un actiu fantasiós.

Barrejar la despesa de prototip amb la producció. La GPU que vas comprar per avaluar el fine-tuning és R+D. El clúster que serveix el trànsit dels clients és producció. Barrejar-los en un sol compte corromp tant el teu marge brut com el suport del teu crèdit d'R+D.

Una llista de verificació de decisions abans de comprar​

Passa per aquestes sis preguntes amb números reals, no intuïcions:

  1. Volum: La despesa mensual sostinguda en API supera aproximadament els 20.000 $, o s'hi encamina de manera creïble dins de dos trimestres?
  2. Quina API estàs substituint? El preu frontera premium arriba al punt d'equilibri prop de mil milions de tokens al mes; el preu d'API econòmic potser mai no arriba al punt d'equilibri.
  3. Forma del trànsit: La càrrega és prou plana perquè les GPU es mantinguin ocupades, o l'aprovisionament per al pic deixarà capacitat desaprofitada?
  4. Expertesa: Algú de l'equip ja parla CUDA, quantització i ajust de vLLM — o estàs pressupostant una contractació dins dels càlculs de retorn?
  5. Efectiu i impostos: Pots finançar el capital inicial, i tens ingressos per utilitzar una deducció de la Secció 179 o accelerada — o et serviria millor MACRS?
  6. Factors no financers: Els requisits de privacitat, compliment normatiu o latència inferior a 100 ms forcen l'autoallotjament independentment del cost?

Tres o més respostes febles signifiquen quedar-se amb l'API (o la divisió híbrida) per ara. La línia encara serà allà quan el teu volum hi creixi — i per llavors, la propera generació de GPU l'haurà desplaçat al teu favor.

Mantén la teva despesa d'inferència llegible​

Tant si pagues per token com per calendari de depreciació, la inferència és ara una de les teves línies de cost més grans, i mereix alguna cosa millor que un sol total misteriós al compte de pèrdues i guanys. Separar la despesa d'API de l'allotjament, les GPU de producció de les caixes de prototip, i la depreciació comptable de la fiscal és el que converteix la línia d'equilibri d'un càlcul puntual en un número que pots vigilar cada mes.

Beancount.io ofereix comptabilitat en text pla que et dona transparència i control complets sobre les teves dades financeres — sense caixes negres, sense dependència de proveïdor. Fes un seguiment del clúster com a actiu fix, enregistra la depreciació segons el calendari, i mira com flueix pels teus informes a Fava. Comença gratis i mantén la despesa de la teva infraestructura d'IA tan llegible com el codi de la teva infraestructura.

Font: https://beancount.io/ca/blog/2026/10/10/gpu-breakeven-line-self-hosted-vllm-vs-llm-api-cogs-guide

Publicat: 10 d’octubre del 2026