Tu factura de API crece en perfecta sincronía con tu éxito. Cada nuevo cliente añade tokens, cada token añade costo, y el monto total aterriza en tu costo de bienes vendidos cada mes. A cierto volumen, esa factura medida cruza una línea: comprar las GPUs directamente y ejecutar la inferencia tú mismo se vuelve más barato que alquilar las de otro. La pregunta es dónde queda esa línea en tu caso — porque cruzarla no es solo una decisión de ingeniería. Reescribe tu balance general, tu margen bruto y tu declaración de impuestos.
Esta guía recorre las matemáticas del punto de equilibrio, por qué el stack de servicio vLLM movió la línea, y qué cambia en tus libros el día que dejas de gastar en llamadas de API y empiezas a capitalizar un clúster de GPUs.
Dos Formas de Pagar por la Inferencia
Cada token que sirve tu producto se paga de una de dos formas, y afectan tus finanzas de manera completamente distinta.
La ruta de API es puro gasto operativo. Pagas por millón de tokens, la factura escala con el uso, y el monto total es un costo del período — lo más natural es registrarlo como costo de bienes vendidos, ya que la inferencia está directamente ligada a entregar tu producto a los clientes. Cero por adelantado, cero activos, cero depreciación. Tu margen bruto recibe el golpe cada mes a una tasa constante sin importar cuánto crezcas.
La ruta autoalojada es principalmente gasto de capital. Compras servidores GPU (o firmas una reserva a largo plazo), pones un activo fijo en el balance general, y lo deprecias a lo largo de su vida útil. Tu estado de resultados mensual entonces muestra depreciación más costos operativos — electricidad, coubicación o espacio en rack, monitoreo, y las horas de ingeniería que mantienen el clúster saludable — en lugar de una factura por token.
Esa diferencia estructural es todo el juego. Los costos de API escalan linealmente con el volumen para siempre. Los costos autoalojados están cargados al frente y son mayormente fijos, así que el costo efectivo por token cae a medida que sube la utilización. En algún punto esas dos curvas se cruzan. Todo lo que sigue trata de encontrar dónde.
Las Matemáticas del Punto de Equilibrio
Un análisis ampliamente citado de 2026 sobre más de 50 despliegues en producción situó la regla general en aproximadamente $20,000 por mes en gasto de API. Por debajo de eso, el costo de ingeniería y operaciones de ejecutar tu propio clúster casi siempre supera los ahorros. Por encima de $50,000 por mes, autoalojar la mayor parte del tráfico típicamente gana por 50 a 70 por ciento. Entre esas líneas hay una zona gris donde los detalles — tus modelos, la forma de tu tráfico, la experiencia en GPU de tu equipo — deciden.
El mismo análisis esbozó la inversión detrás de esos números: $50,000 a $500,000 por adelantado en hardware GPU dependiendo del tamaño del modelo, más $3,000 a $15,000 por mes en operaciones continuas. Eso va desde una sola caja usada de clase A100 sirviendo un modelo de 70 mil millones de parámetros hasta un clúster multi-nodo de H100.
Importa enormemente qué API estás reemplazando
El volumen de punto de equilibrio se desplaza aproximadamente 100x dependiendo de lo que pagas por token hoy:
| Volumen mensual | Costo de API frontera (aprox.) | Costo autoalojado (hardware propio) | Ahorro mensual |
|---|---|---|---|
| 100M tokens | $1,750 | $5,500 | -$3,750 (pérdida) |
| 500M tokens | $8,750 | $7,500 | $1,250 (recuperación en 20 meses) |
| 1B tokens | $17,500 | $10,000 | $7,500 (recuperación en 7 meses) |
| 5B tokens | $87,500 | $25,000 | $62,500 (recuperación en 1 mes) |
Contra una API frontera premium que cobra del orden de $1,750 por 100 millones de tokens, el cruce aterriza alrededor de medio billón a un billón de tokens al mes, y la recuperación se acelera fuertemente desde ahí.
Pero reemplaza una API económica que cobra más cerca de $80 por 100 millones de tokens y las matemáticas se invierten: necesitarías 50 mil millones o más de tokens al mes para alcanzar el punto de equilibrio — un volumen que exige un clúster serio multi-GPU y un equipo de infraestructura dedicado. Si una API barata cumple con tu estándar de calidad, el autoalojamiento rara vez tiene sentido financiero a cualquier volumen que una pequeña empresa pueda alcanzar.
La utilización lo es todo
Otros desgloses de costos sitúan el punto de equilibrio mucho más bajo — un modelo detallado de construir-vs-alquilar lo coloca cerca de $4,200 al mes en gasto de API — y la brecha entre estimaciones es en sí misma la lección: no existe un punto de equilibrio universal. Todo el cálculo depende de la utilización. Una GPU sirviendo tráfico constante las 24 horas reparte su costo fijo entre miles de millones de tokens. La misma GPU sirviendo tráfico irregular de día permanece inactiva toda la noche, depreciándose sin nada que mostrar, y las horas inactivas silenciosamente duplican o triplican tu verdadero costo por token.
Antes de confiar en la cifra de punto de equilibrio de cualquier persona, incluida la de este artículo, mide la forma de tu propio tráfico: tokens sostenidos por segundo, ratio pico-promedio, y pendiente de crecimiento. El volumen plano, predecible y creciente favorece el autoalojamiento. El volumen irregular o bajo favorece el costo cero por inactividad de la API.
Por Qué vLLM Movió la Línea
El stack de servicio que elijas es una variable financiera, no solo técnica. El rendimiento por GPU decide cuántas GPUs debes comprar, y la diferencia entre un bucle de servicio ingenuo y un motor de inferencia moderno es enorme.
vLLM se ha convertido en la elección de producción por defecto mediante dos técnicas que vienen habilitadas de fábrica:
- Batching continuo mantiene cada ranura de GPU llena mezclando solicitudes nuevas y en curso en lugar de esperar a que termine un lote completo, elevando el rendimiento aproximadamente 2 a 3x sobre el batching estático.
- PagedAttention gestiona la caché de clave-valor en bloques en lugar de preasignar memoria contigua, reduciendo el desperdicio por fragmentación y soportando 2 a 4x más solicitudes concurrentes en la misma tarjeta.
Combinado con paralelismo tensorial entre GPUs y soporte para pesos cuantizados, vLLM entrega del orden de 24x el rendimiento de un bucle de servicio transformers ingenuo — lo que significa aproximadamente 24x menos GPUs que comprar para el mismo tráfico. Un clúster dimensionado sin estas técnicas no es solo más lento; es un error de gasto de capital.
Dos propiedades más importan para el caso de negocio. Primero, vLLM expone endpoints compatibles con OpenAI, así que migrar el tráfico masivo fuera de una API es en gran medida un cambio de URL y clave en lugar de una reescritura — el costo de cambio se mantiene bajo. Segundo, la restricción: solo puedes autoalojar modelos de peso abierto como Llama, Qwen, DeepSeek y Mistral. Los modelos frontera de los grandes laboratorios permanecen solo como API, por lo que el estado final común es un híbrido: autoalojar un modelo abierto para el 80 por ciento del tráfico que es rutinario, y seguir enrutando el 20 por ciento que necesita razonamiento frontera a través de una API.
Qué Cambia en Tus Libros Cuando Autoalojas
El día que llegan los servidores GPU, tu contabilidad cambia en cinco lugares. Hazlos bien y las matemáticas del punto de equilibrio que ejecutaste realmente se muestran en tus finanzas.
1. El hardware se convierte en un activo fijo
Los servidores GPU comprados son activos de capital, no suministros. Registras el precio de compra más los costos directos de poner el clúster en servicio — flete, instalación en rack, mano de obra de configuración inicial — como un activo fijo en el balance general, luego lo deprecias. Las computadoras y equipos relacionados generalmente son propiedad MACRS a 5 años, y la depreciación comienza cuando el activo se pone en servicio (listo y disponible para su uso previsto), no cuando pagas la factura.
El puerto seguro de minimis de $2,500 que te permite gastar compras pequeñas no cubrirá un servidor GPU. No pases un clúster de $60,000 por suministros de oficina.
2. Obtienes una elección genuina de sincronización fiscal en 2026
Para impuestos federales, la ley actual te da tres velocidades para el mismo hardware:
- Gasto de la Sección 179: deducir hasta $2,560,000 de equipo calificado puesto en servicio en 2026, con el beneficio eliminándose dólar por dólar una vez que las compras calificadas totales excedan $4,090,000. La deducción no puede exceder tu ingreso comercial gravable, pero los montos no usados se arrastran.
- Depreciación adicional del 100 por ciento: restaurada permanentemente para propiedad calificada adquirida después del 19 de enero de 2025. A diferencia de la Sección 179, puede crear una pérdida y no tiene tope en dólares.
- MACRS regular: repartir la deducción sobre 5 años.
Una pequeña empresa rentable comprando su primer clúster a menudo gastará todo en el primer año. Una startup aún no rentable puede preferir MACRS, preservando deducciones para años en que haya ingreso que compensar. De cualquier manera, rastrea la depreciación contable y fiscal por separado — tus estados financieros deben reflejar la realidad económica a lo largo de la vida útil del activo incluso cuando la declaración de impuestos la toma toda de una vez.
3. Las GPUs alquiladas siguen siendo gasto operativo
Nada de lo anterior aplica si alquilas GPUs en la nube por hora. Los alquileres por hora, las instancias reservadas y las suscripciones de GPU en la nube son costos operativos del período — más cercanos a la ruta de API que a la propiedad. Ese es un punto intermedio legítimo (sin capital por adelantado, aún medido), pero no esperes un activo en el balance general ni una deducción por depreciación de una factura de alquiler. La decisión CapEx-vs-OpEx y la decisión construir-vs-comprar son dos ejes separados.
4. Los costos continuos del clúster se dividen entre COGS y OpEx
Una vez en funcionamiento, clasifica los costos por lo que apoyan:
- En COGS (escalan con servir a los clientes): electricidad para nodos de producción, coubicación y ancho de banda para el clúster de servicio, monitoreo y registro para producción, y la depreciación de las GPUs de producción.
- En gasto operativo: la caja de prototipo en la que experimentan tus ingenieros, entornos de staging, e infraestructura general de I+D.
La misma división aplica a la mano de obra. El tiempo de ingeniería dedicado a mantener en pie la inferencia de producción apoya la entrega y puede ubicarse en COGS; el tiempo dedicado a evaluar el modelo del próximo trimestre es I+D. Los márgenes brutos de SaaS típicamente se referencian en 70 a 85 por ciento, y clasificar mal en cualquier dirección hace que tu margen no sea comparable — pon el gasto de API y hosting en gastos generales y tu margen se ve artificialmente maravilloso mientras tu OpEx se ve inflado.
5. Tu margen bruto debería expandirse más allá del punto de equilibrio
Vigila esta identidad cada mes después de la migración: la línea de API en COGS debería caer hacia cero (o hacia el remanente frontera del 20 por ciento en una configuración híbrida), reemplazada por una cifra combinada menor de depreciación más hosting. Si el margen bruto no mejora dentro de uno o dos trimestres de operación en estado estable, o la utilización es menor a la modelada o los costos operativos ocultos se comieron los ahorros — lo que es tu señal para revisar la decisión en lugar de defenderla.
En un libro de texto plano, la compra misma es un asiento balanceado — un intercambio de activo de efectivo a equipo, con asientos de depreciación reconociendo el costo mes a mes. Si nunca has modelado activos fijos de esta manera, la documentación de Beancount recorre cuentas, registros de depreciación e informes paso a paso.
Errores Que Borran los Ahorros
La mayoría de las migraciones fallidas de autoalojamiento no fallan en los benchmarks de GPU. Fallan en costos que la hoja de cálculo omitió:
Dimensionar para el pico, pagar por el promedio. Un clúster aprovisionado para tu hora más ocupada corre medio vacío el resto del día. Cada hora inactiva es depreciación sin tokens. El autoescalado ayuda en GPUs alquiladas; en hardware propio, la única solución es suficiente volumen base.
Olvidar la cola de operaciones. Un desglose detallado sitúa los costos mensuales ocultos en $4,700 a $7,900 sobre el hardware para una modesta configuración de 4 GPUs: 8 a 20 horas de ingeniería al mes ($2,500 a $5,000 con salarios cargados), electricidad ($400 a $600), redes y almacenamiento, monitoreo, y un repuesto de redundancia. Nada de eso aparece en una comparación de precios de GPU.
Ignorar la brecha de disponibilidad. Los proveedores de API típicamente respaldan 99.9 por ciento de disponibilidad por SLA. Un clúster autooperado sin inversión seria en redundancia aterriza realistamente en 95 a 99 por ciento — tarjetas fallidas, caídas por falta de memoria, una actualización de driver CUDA que rompe el despliegue a las 2 a.m. Sobre $100,000 al mes de ingresos impulsados por IA, un punto extra de tiempo de inactividad cuesta $1,000 al mes, antes de contar la respuesta al incidente.
Registrar el gasto de API como gastos generales. Si los costos de inferencia se ubican en gastos generales en lugar de COGS, tu margen bruto es ficción en ambas direcciones: sobreestimado antes de la migración, y la mejora post-migración invisible. Corrige la clasificación antes de comparar.
Optimismo en la vida útil. Algunos hiperescaladores deprecian GPUs sobre 5 a 6 años mientras los analistas argumentan que la vida económica está más cerca de 2 a 3 dado lo rápido que cada generación deja obsoleta a la anterior. Si el valor de reventa de tu clúster se desploma cuando se lanza la próxima arquitectura, registra un deterioro en lugar de cargar un activo de fantasía.
Mezclar el gasto de prototipo con producción. La GPU que compraste para evaluar el ajuste fino es I+D. El clúster sirviendo tráfico de clientes es producción. Mezclarlos en una cuenta corrompe tanto tu margen bruto como tu soporte para el crédito de I+D.
Una Lista de Verificación de Decisión Antes de Comprar
Repasa estas seis preguntas con números reales, no con presentimientos:
- Volumen: ¿Está el gasto sostenido mensual de API por encima de aproximadamente $20,000, o credíblemente encaminado hacia allá dentro de dos trimestres?
- ¿Qué API estás reemplazando? El precio frontera premium alcanza el punto de equilibrio cerca de un billón de tokens al mes; el precio de API económica puede que nunca alcance el punto de equilibrio.
- Forma del tráfico: ¿Es la carga lo suficientemente plana para que las GPUs se mantengan ocupadas, o el aprovisionamiento para el pico dejará capacidad varada?
- Experiencia: ¿Alguien en el equipo ya habla CUDA, cuantización y ajuste de vLLM — o estás presupuestando una contratación dentro de las matemáticas de recuperación?
- Efectivo e impuestos: ¿Puedes financiar el capital por adelantado, y tienes el ingreso para usar una deducción de la Sección 179 o adicional — o MACRS te serviría mejor?
- Impulsores no financieros: ¿La privacidad, el cumplimiento, o los requisitos de latencia bajo 100ms fuerzan el autoalojamiento independientemente del costo?
Tres o más respuestas débiles significan quedarse en la API (o la división híbrida) por ahora. La línea todavía estará ahí cuando tu volumen crezca hacia ella — y para entonces, la próxima generación de GPUs la habrá movido a tu favor.
Mantén Legible Tu Gasto de Inferencia
Ya sea que pagues por token o por calendario de depreciación, la inferencia es ahora una de tus mayores líneas de costo, y merece algo mejor que un único total misterioso en el estado de resultados. Separar el gasto de API del hosting, las GPUs de producción de las cajas de prototipo, y la depreciación contable de la fiscal es lo que convierte la línea de punto de equilibrio de un cálculo único en un número que puedes vigilar cada mes.
Beancount.io ofrece contabilidad de texto plano que te da transparencia y control completos sobre tus datos financieros — sin cajas negras, sin dependencia de proveedor. Rastrea el clúster como un activo fijo, registra la depreciación según el calendario, y mira cómo fluye a través de tus informes en Fava. Empieza gratis y mantén tu gasto de infraestructura de IA tan legible como tu código de infraestructura.





