Ihre API-Rechnung wächst im perfekten Gleichschritt mit Ihrem Erfolg. Jeder neue Kunde fügt Tokens hinzu, jedes Token fügt Kosten hinzu, und der gesamte Betrag landet Monat für Monat in Ihren Herstellungskosten. Ab einem bestimmten Volumen überschreitet diese nutzungsabhängige Rechnung eine Grenze: Die GPUs direkt zu kaufen und die Inferenz selbst zu betreiben, wird günstiger, als die von jemand anderem zu mieten. Die Frage ist, wo diese Grenze für Sie liegt — denn sie zu überschreiten ist nicht nur eine technische Entscheidung. Sie schreibt Ihre Bilanz, Ihre Bruttomarge und Ihre Steuererklärung neu.
Dieser Leitfaden führt durch die Gewinnschwellenrechnung, erklärt, warum der vLLM-Serving-Stack die Grenze verschoben hat, und zeigt, was sich in Ihren Büchern ändert, an dem Tag, an dem Sie aufhören, API-Aufrufe als Aufwand zu verbuchen, und anfangen, einen GPU-Cluster zu aktivieren.
Zwei Arten, für Inferenz zu bezahlen
Jedes Token, das Ihr Produkt verarbeitet, wird auf eine von zwei Arten bezahlt, und diese wirken sich völlig unterschiedlich auf Ihre Finanzen aus.
Der API-Weg ist reiner Betriebsaufwand. Sie zahlen pro Million Tokens, die Rechnung skaliert mit der Nutzung, und der volle Betrag ist eine Periodenkosten — am natürlichsten verbucht als Herstellungskosten, da Inferenz direkt mit der Bereitstellung Ihres Produkts für Kunden zusammenhängt. Null Vorabkosten, null Vermögenswerte, null Abschreibung. Ihre Bruttomarge nimmt jeden Monat zu einem konstanten Satz Schaden, egal wie groß Sie werden.
Der Selbsthosting-Weg ist überwiegend Investitionsausgaben. Sie kaufen GPU-Server (oder schließen eine langfristige Reservierung ab), setzen einen Vermögenswert in die Bilanz und schreiben ihn über seine Nutzungsdauer ab. Ihre monatliche GuV zeigt dann Abschreibung plus Betriebskosten — Strom, Colocation oder Rack-Platz, Monitoring und die Engineering-Stunden, die den Cluster gesund halten — anstelle einer Rechnung pro Token.
Dieser strukturelle Unterschied ist das ganze Spiel. API-Kosten skalieren für immer linear mit dem Volumen. Selbsthosting-Kosten sind vorab konzentriert und überwiegend fix, sodass die effektiven Kosten pro Token mit steigender Auslastung sinken. Irgendwo kreuzen sich diese beiden Kurven. Alles Folgende dreht sich darum, diese Stelle zu finden.
Die Gewinnschwellenrechnung
Eine viel zitierte Analyse aus dem Jahr 2026 über mehr als 50 Produktions-Deployments setzte die Faustregel bei etwa 20.000 $ pro Monat an API-Ausgaben an. Darunter übersteigen die Engineering- und Betriebskosten für den Betrieb eines eigenen Clusters fast immer die Einsparungen. Über 50.000 $ pro Monat gewinnt Selbsthosting des Großteils des Datenverkehrs typischerweise um 50 bis 70 Prozent. Zwischen diesen Linien liegt eine Grauzone, in der die Details — Ihre Modelle, die Form Ihres Datenverkehrs, die GPU-Erfahrung Ihres Teams — entscheiden.
Dieselbe Analyse skizzierte die Investition hinter diesen Zahlen: 50.000 $ bis 500.000 $ Vorabkosten für GPU-Hardware je nach Modellgröße, plus 3.000 $ bis 15.000 $ pro Monat laufender Betriebskosten. Das reicht von einer einzelnen gebrauchten Maschine der A100-Klasse, die ein Modell mit 70 Milliarden Parametern bedient, bis zu einem Multi-Node-H100-Cluster.
Es macht einen enormen Unterschied, welche API Sie ersetzen
Das Gewinnschwellenvolumen verschiebt sich um etwa das 100-Fache, je nachdem, was Sie heute pro Token zahlen:
| Monatliches Volumen | Frontier-API-Kosten (ca.) | Selbsthosting-Kosten (eigene Hardware) | Monatliche Einsparung |
|---|---|---|---|
| 100 Mio. Tokens | 1.750 $ | 5.500 $ | -3.750 $ (Verlust) |
| 500 Mio. Tokens | 8.750 $ | 7.500 $ | 1.250 $ (20 Monate Amortisation) |
| 1 Mrd. Tokens | 17.500 $ | 10.000 $ | 7.500 $ (7 Monate Amortisation) |
| 5 Mrd. Tokens | 87.500 $ | 25.000 $ | 62.500 $ (1 Monat Amortisation) |
Gegenüber einer Premium-Frontier-API, die in der Größenordnung von 1.750 $ pro 100 Millionen Tokens berechnet, liegt der Schnittpunkt bei etwa einer halben bis einer Milliarde Tokens pro Monat, und die Amortisation beschleunigt sich von dort stark.
Ersetzen Sie jedoch eine Budget-API, die eher 80 $ pro 100 Millionen Tokens berechnet, kehrt sich die Rechnung um: Sie bräuchten über 50 Milliarden Tokens pro Monat, um die Gewinnschwelle zu erreichen — ein Volumen, das einen ernsthaften Multi-GPU-Cluster und ein dediziertes Infrastrukturteam erfordert. Wenn eine günstige API Ihre Qualitätsanforderungen erfüllt, ist Selbsthosting bei jedem Volumen, das ein Kleinunternehmen erreichen wird, selten finanziell sinnvoll.
Die Auslastung ist alles
Andere Kostenaufschlüsselungen setzen die Gewinnschwelle viel niedriger an — ein detailliertes Build-vs-Rent-Modell verortet sie bei etwa 4.200 $ pro Monat an API-Ausgaben — und die Spanne zwischen den Schätzungen ist selbst die Lektion: Es gibt keinen universellen Gewinnschwellenpunkt. Die gesamte Berechnung hängt von der Auslastung ab. Eine GPU, die rund um die Uhr gleichmäßigen Datenverkehr bedient, verteilt ihre Fixkosten über Milliarden von Tokens. Dieselbe GPU, die stoßartigen Tagesverkehr bedient, steht die ganze Nacht still, schreibt sich ab, ohne etwas vorzuweisen, und die Leerlaufstunden verdoppeln oder verdreifachen still und leise Ihre tatsächlichen Kosten pro Token.
Bevor Sie irgendeiner Gewinnschwellenzahl vertrauen, einschließlich der in diesem Artikel, messen Sie die Form Ihres eigenen Datenverkehrs: anhaltende Tokens pro Sekunde, Verhältnis von Spitzen- zu Durchschnittslast und Wachstumskurve. Gleichmäßiges, vorhersehbares, wachsendes Volumen begünstigt Selbsthosting. Stoßartiges oder geringes Volumen begünstigt die Null-Leerlaufkosten der API.
Warum vLLM die Grenze verschoben hat
Der Serving-Stack, den Sie wählen, ist eine finanzielle Variable, nicht nur eine technische. Der Durchsatz pro GPU entscheidet, wie viele GPUs Sie kaufen müssen, und die Spanne zwischen einer naiven Serving-Schleife und einer modernen Inferenz-Engine ist enorm.
vLLM ist durch zwei Techniken, die ab Werk aktiviert sind, zur Standardwahl in der Produktion geworden:
- Continuous Batching hält jeden GPU-Slot gefüllt, indem neue und laufende Anfragen gemischt werden, anstatt zu warten, bis ein ganzer Batch fertig ist, und steigert den Durchsatz um etwa das 2- bis 3-Fache gegenüber statischem Batching.
- PagedAttention verwaltet den Key-Value-Cache in Blöcken statt durch Vorabzuweisung zusammenhängenden Speichers, reduziert Fragmentierungsverschwendung und unterstützt 2- bis 4-mal mehr gleichzeitige Anfragen auf derselben Karte.
In Kombination mit Tensor-Parallelität über GPUs hinweg und Unterstützung für quantisierte Gewichte liefert vLLM in der Größenordnung des 24-Fachen des Durchsatzes einer naiven Transformers-Serving-Schleife — was bedeutet, dass Sie für denselben Datenverkehr etwa 24-mal weniger GPUs kaufen müssen. Ein Cluster, das ohne diese Techniken dimensioniert wurde, ist nicht nur langsamer; es ist ein Investitionsfehler.
Zwei weitere Eigenschaften sind für den Geschäftsfall wichtig. Erstens stellt vLLM OpenAI-kompatible Endpunkte bereit, sodass die Migration des Großteils des Datenverkehrs von einer API weitgehend eine URL- und Schlüsseländerung statt einer Neuentwicklung ist — die Wechselkosten bleiben niedrig. Zweitens die Einschränkung: Sie können nur Open-Weight-Modelle wie Llama, Qwen, DeepSeek und Mistral selbst hosten. Frontier-Modelle der großen Labore bleiben API-exklusiv, weshalb der übliche Endzustand ein Hybrid ist: ein offenes Modell für die 80 Prozent des Datenverkehrs selbst hosten, der Routine ist, und die 20 Prozent, die Frontier-Reasoning benötigen, weiterhin über eine API leiten.
Was sich in Ihren Büchern ändert, wenn Sie selbst hosten
An dem Tag, an dem die GPU-Server ankommen, ändert sich Ihre Buchhaltung an fünf Stellen. Machen Sie diese richtig, und die Gewinnschwellenrechnung, die Sie durchgeführt haben, zeigt sich tatsächlich in Ihren Finanzen.
1. Die Hardware wird zum Anlagevermögen
Gekaufte GPU-Server sind Kapitalanlagen, keine Verbrauchsmaterialien. Sie erfassen den Kaufpreis plus die direkten Kosten, um den Cluster in Betrieb zu nehmen — Fracht, Rack-Installation, Arbeitsaufwand für die Erstkonfiguration — als Anlagevermögen in der Bilanz und schreiben es dann ab. Computer und zugehörige Ausrüstung sind im Allgemeinen 5-Jahres-MACRS-Wirtschaftsgut, und die Abschreibung beginnt, wenn der Vermögenswert in Betrieb genommen wird (bereit und verfügbar für seinen beabsichtigten Zweck), nicht wenn Sie die Rechnung bezahlen.
Die De-minimis-Wertgrenze von 2.500 $, die es erlaubt, kleine Anschaffungen als Aufwand zu verbuchen, deckt einen GPU-Server nicht ab. Buchen Sie keinen 60.000-$-Cluster über Büromaterial.
2. Sie haben 2026 eine echte steuerliche Timing-Wahl
Für Bundessteuern gibt Ihnen das geltende Recht drei Geschwindigkeiten für dieselbe Hardware:
- Section-179-Aufwand: Abzug von bis zu 2.560.000 $ qualifizierter Ausrüstung, die 2026 in Betrieb genommen wird, wobei der Vorteil Dollar für Dollar entfällt, sobald die gesamten qualifizierten Käufe 4.090.000 $ übersteigen. Der Abzug darf Ihr zu versteuerndes Betriebseinkommen nicht übersteigen, aber nicht genutzte Beträge werden vorgetragen.
- 100 Prozent Bonusabschreibung: dauerhaft wiederhergestellt für qualifiziertes Vermögen, das nach dem 19. Januar 2025 erworben wurde. Anders als Section 179 kann sie einen Verlust erzeugen und hat keine Dollargrenze.
- Reguläre MACRS: Verteilung des Abzugs über 5 Jahre.
Ein profitables Kleinunternehmen, das seinen ersten Cluster kauft, wird oft alles im ersten Jahr als Aufwand verbuchen. Ein Startup vor der Gewinnzone bevorzugt möglicherweise MACRS und bewahrt die Abzüge für Jahre mit auszugleichendem Einkommen auf. In jedem Fall sollten Sie Bilanz- und Steuerabschreibung getrennt verfolgen — Ihre Finanzberichte sollten die wirtschaftliche Realität über die Nutzungsdauer des Vermögenswerts widerspiegeln, auch wenn die Steuererklärung alles auf einmal abzieht.
3. Gemietete GPUs bleiben Betriebsaufwand
Nichts des oben Genannten gilt, wenn Sie Cloud-GPUs stundenweise mieten. Stundenmieten, Reserved Instances und GPU-Cloud-Abonnements sind Perioden-Betriebskosten — näher am API-Weg als am Eigentum. Das ist ein legitimer Mittelweg (kein Vorabkapital, dennoch nutzungsabhängig), aber erwarten Sie keine Bilanzposition oder Abschreibung von einer Mietrechnung. Die CapEx-vs-OpEx-Entscheidung und die Build-vs-Buy-Entscheidung sind zwei separate Achsen.
4. Laufende Cluster-Kosten teilen sich zwischen COGS und OpEx
Klassifizieren Sie die Kosten im laufenden Betrieb danach, was sie unterstützen:
- In die COGS (sie skalieren mit der Bedienung von Kunden): Strom für Produktionsknoten, Colocation und Bandbreite für den Serving-Cluster, Monitoring und Logging für die Produktion und die Abschreibung auf Produktions-GPUs.
- In die Betriebskosten: die Prototyp-Maschine, auf der Ihre Entwickler experimentieren, Staging-Umgebungen und allgemeine F&E-Infrastruktur.
Dieselbe Aufteilung gilt für Arbeitskraft. Engineering-Zeit, die für die Aufrechterhaltung der Produktionsinferenz aufgewendet wird, unterstützt die Bereitstellung und kann in den COGS liegen; Zeit für die Bewertung des Modells des nächsten Quartals ist F&E. Die Bruttomargen von SaaS werden typischerweise mit 70 bis 85 Prozent bemessen, und eine Fehlklassifizierung in beide Richtungen macht Ihre Marge unvergleichbar — legen Sie API- und Hosting-Ausgaben in die Gemeinkosten, und Ihre Marge sieht künstlich wunderbar aus, während Ihre OpEx aufgebläht wirkt.
5. Ihre Bruttomarge sollte sich nach der Gewinnschwelle ausweiten
Beobachten Sie diese Identität monatlich nach der Migration: Die API-Zeile in den COGS sollte gegen null fallen (oder gegen den 20-prozentigen Frontier-Rest in einem Hybrid-Setup), ersetzt durch einen kleineren kombinierten Abschreibungs-plus-Hosting-Betrag. Wenn sich die Bruttomarge nicht innerhalb eines oder zweier Quartale im eingeschwungenen Betrieb verbessert, ist entweder die Auslastung niedriger als modelliert oder verborgene Betriebskosten haben die Einsparungen aufgezehrt — was Ihr Signal ist, die Entscheidung zu überdenken, statt sie zu verteidigen.
In einem Plain-Text-Hauptbuch ist der Kauf selbst eine ausgeglichene Buchung — ein Aktivtausch von Bargeld zu Ausrüstung, mit Abschreibungsbuchungen, die die Kosten Monat für Monat erfassen. Wenn Sie Anlagevermögen noch nie auf diese Weise modelliert haben, führt die Beancount-Dokumentation Sie Schritt für Schritt durch Konten, Abschreibungsbuchungen und Berichte.
Fehler, die die Einsparungen zunichtemachen
Die meisten gescheiterten Selbsthosting-Migrationen scheitern nicht an GPU-Benchmarks. Sie scheitern an Kosten, die die Tabellenkalkulation ausgelassen hat:
Auf die Spitze dimensionieren, für den Durchschnitt bezahlen. Ein Cluster, das für Ihre verkehrsreichste Stunde ausgelegt ist, läuft den Rest des Tages halb leer. Jede Leerlaufstunde ist Abschreibung ohne Tokens. Autoscaling hilft bei gemieteten GPUs; bei eigener Hardware ist die einzige Lösung ausreichend Grundlastvolumen.
Den Betriebsüberhang vergessen. Eine detaillierte Aufschlüsselung beziffert die versteckten monatlichen Kosten auf 4.700 $ bis 7.900 $ zusätzlich zur Hardware für ein bescheidenes 4-GPU-Setup: 8 bis 20 Engineering-Stunden pro Monat (2.500 $ bis 5.000 $ bei Vollkosten-Gehältern), Strom (400 $ bis 600 $), Netzwerk und Speicher, Monitoring und ein Redundanz-Ersatz. Nichts davon erscheint in einem GPU-Preisvergleich.
Die Uptime-Lücke ignorieren. API-Anbieter sichern typischerweise 99,9 Prozent SLA-Uptime zu. Ein selbst betriebener Cluster ohne ernsthafte Redundanzinvestition erreicht realistisch 95 bis 99 Prozent — ausgefallene Karten, Out-of-Memory-Abstürze, ein CUDA-Treiber-Update, das um 2 Uhr nachts das Deployment bricht. Bei 100.000 $ pro Monat KI-getriebenen Umsatzes kostet ein zusätzlicher Prozentpunkt Ausfallzeit 1.000 $ pro Monat, noch bevor die Incident-Response gezählt wird.
API-Ausgaben als Gemeinkosten verbuchen. Wenn Inferenzkosten in den allgemeinen Ausgaben statt in den COGS liegen, ist Ihre Bruttomarge in beide Richtungen Fiktion: überhöht vor der Migration, und die Verbesserung nach der Migration unsichtbar. Korrigieren Sie die Klassifizierung, bevor Sie vergleichen.
Optimismus bei der Nutzungsdauer. Manche Hyperscaler schreiben GPUs über 5 bis 6 Jahre ab, während Analysten argumentieren, dass die wirtschaftliche Lebensdauer eher bei 2 bis 3 Jahren liegt, so schnell veraltet jede Generation die vorherige. Wenn der Wiederverkaufswert Ihres Clusters beim Erscheinen der nächsten Architektur zusammenbricht, buchen Sie eine Wertminderung, statt einen Fantasie-Vermögenswert mitzuführen.
Prototyp-Ausgaben mit Produktion vermischen. Die GPU, die Sie zur Bewertung von Fine-Tuning gekauft haben, ist F&E. Der Cluster, der Kundenverkehr bedient, ist Produktion. Beide in einem Konto zu mischen, verfälscht sowohl Ihre Bruttomarge als auch Ihre F&E-Gutschriften-Nachweise.
Eine Entscheidungs-Checkliste, bevor Sie kaufen
Gehen Sie diese sechs Fragen mit echten Zahlen durch, nicht mit Bauchgefühl:
- Volumen: Liegen die anhaltenden monatlichen API-Ausgaben über etwa 20.000 $, oder bewegen sie sich glaubhaft innerhalb von zwei Quartalen dorthin?
- Welche API ersetzen Sie? Premium-Frontier-Preise erreichen die Gewinnschwelle bei etwa einer Milliarde Tokens pro Monat; Budget-API-Preise erreichen sie möglicherweise nie.
- Verkehrsform: Ist die Last gleichmäßig genug, dass die GPUs beschäftigt bleiben, oder wird die Spitzen-Dimensionierung Kapazität brachliegen lassen?
- Expertise: Spricht jemand im Team bereits CUDA, Quantisierung und vLLM-Tuning — oder budgetieren Sie eine Neueinstellung in die Amortisationsrechnung ein?
- Kapital und Steuern: Können Sie das Vorabkapital finanzieren, und haben Sie das Einkommen, um einen Section-179- oder Bonusabzug zu nutzen — oder würde MACRS Ihnen besser dienen?
- Nicht-finanzielle Treiber: Erzwingen Datenschutz-, Compliance- oder Sub-100-ms-Latenzanforderungen Selbsthosting unabhängig von den Kosten?
Drei oder mehr schwache Antworten bedeuten, vorerst bei der API (oder der Hybrid-Aufteilung) zu bleiben. Die Grenze wird noch da sein, wenn Ihr Volumen in sie hineinwächst — und bis dahin wird die nächste GPU-Generation sie zu Ihren Gunsten verschoben haben.
Halten Sie Ihre Inferenz-Ausgaben lesbar
Ob Sie pro Token oder pro Abschreibungsplan zahlen, Inferenz ist heute eine Ihrer größten Kostenpositionen, und sie verdient mehr als eine einzelne undurchsichtige Summe in der GuV. API-Ausgaben von Hosting zu trennen, Produktions-GPUs von Prototyp-Maschinen und Bilanzabschreibung von Steuerabschreibung — das macht aus der Gewinnschwelle eine einmalige Berechnung eine Zahl, die Sie jeden Monat beobachten können.
Beancount.io bietet Plain-Text-Buchhaltung, die Ihnen vollständige Transparenz und Kontrolle über Ihre Finanzdaten gibt — keine Blackbox, kein Vendor-Lock-in. Verfolgen Sie den Cluster als Anlagevermögen, buchen Sie die Abschreibung fristgerecht und beobachten Sie, wie sie durch Ihre Berichte in Fava fließt. Starten Sie kostenlos und halten Sie Ihre KI-Infrastrukturausgaben so lesbar wie Ihren Infrastruktur-Code.





