صورتحساب API شما دقیقاً همگام با موفقیتتان رشد میکند. هر مشتری جدید توکنها را افزایش میدهد، هر توکن هزینه را بیشتر میکند، و کل این مبلغ هر ماه در بهای تمامشدهٔ کالای فروختهشدهٔ شما مینشیند. در حجمی مشخص، آن صورتحساب مصرفی از یک خط عبور میکند: خرید مستقیم GPUها و اجرای خودِ استنتاج ارزانتر از اجارهٔ متعلق به دیگری میشود. پرسش اینجاست که آن خط برای شما کجاست — چون عبور از آن تنها یک تصمیم مهندسی نیست. ترازنامه، حاشیهٔ سود ناخالص و اظهارنامهٔ مالیاتی شما را از نو مینویسد.
این راهنما محاسبهٔ سربهسر، اینکه چرا پشتهٔ سرویسدهی vLLM این خط را جابهجا کرد، و اینکه روزی که هزینهٔ فراخوانیهای API را متوقف و کلاستر GPU را سرمایهای میکنید چه چیزی در دفاترتان تغییر میکند را توضیح میدهد.
دو راه برای پرداخت هزینهٔ استنتاج
هر توکنی که محصول شما سرو میکند به یکی از دو صورت پرداخت میشود، و این دو کاملاً متفاوت بر صورتهای مالی شما اثر میگذارند.
مسیر API هزینهٔ عملیاتی خالص است. شما بهازای هر میلیون توکن پرداخت میکنید، صورتحساب با میزان مصرف بالا میرود، و کل مبلغ یک هزینهٔ دورهای است — بهطور طبیعیتر بهعنوان بهای تمامشدهٔ کالای فروختهشده ثبت میشود، چون استنتاج مستقیماً به تحویل محصول شما به مشتریان گره خورده است. بدون پیشپرداخت، بدون دارایی، بدون استهلاک. حاشیهٔ سود ناخالص شما هر ماه با نرخی ثابت ضربه میخورد، هرچقدر هم که بزرگ شوید.
مسیر خودمیزبانی عمدتاً هزینهٔ سرمایهای است. شما سرورهای GPU را میخرید (یا قراردادی بلندمدت امضا میکنید)، دارایی ثابتی روی ترازنامه میگذارید، و آن را در طول عمر مفیدش مستهلک میکنید. صورت سود و زیان ماهانهٔ شما سپس استهلاک بهعلاوهٔ هزینههای عملیاتی — برق، جایگاه رک یا هممکانی، پایش، و ساعتهای مهندسی که کلاستر را سالم نگه میدارد — را بهجای صورتحساب هر توکن نشان میدهد.
این تفاوت ساختاری تمام ماجراست. هزینههای API برای همیشه بهصورت خطی با حجم بالا میروند. هزینههای خودمیزبانی پیشپرداختشده و عمدتاً ثابتاند، بنابراین هزینهٔ مؤثر هر توکن با افزایش بهرهبرداری کاهش مییابد. جایی این دو منحنی یکدیگر را قطع میکنند. تمام مطلب زیر دربارهٔ یافتن آن نقطه است.
محاسبهٔ سربهسر
تحلیلی پراستناد در ۲۰۲۶ بر بیش از ۵۰ استقرار تولیدی، قاعدهٔ سرانگشتی را حدود ۲۰٬۰۰۰ دلار در ماه هزینهٔ API تعیین کرد. پایینتر از آن، هزینهٔ مهندسی و عملیات اجرای کلاستر خودتان تقریباً همیشه از صرفهجویی بیشتر است. بالای ۵۰٬۰۰۰ دلار در ماه، خودمیزبانی بخش عمدهٔ ترافیک معمولاً با برتری ۵۰ تا ۷۰ درصدی پیروز میشود. بین این دو خط، منطقهٔ خاکستری قرار دارد که جزئیات — مدلهای شما، شکل ترافیکتان، تجربهٔ GPU تیمتان — تصمیم میگیرند.
همان تحلیل سرمایهگذاری پشت این اعداد را ترسیم کرد: ۵۰٬۰۰۰ تا ۵۰۰٬۰۰۰ دلار پیشپرداخت برای سختافزار GPU بسته به اندازهٔ مدل، بهعلاوهٔ ۳٬۰۰۰ تا ۱۵٬۰۰۰ دلار در ماه هزینهٔ عملیات جاری. این دامنه از یک جعبهٔ کلاس A100 دستدوم برای سرو کردن یک مدل ۷۰ میلیارد پارامتری تا یک کلاستر چندگرهای H100 را در برمیگیرد.
اینکه کدام API را جایگزین میکنید اهمیت بسیاری دارد
حجم سربهسر بسته به آنکه امروز بهازای هر توکن چقدر میپردازید حدود ۱۰۰ برابر جابهجا میشود:
| حجم ماهانه | هزینهٔ API پیشرو (تقریبی) | هزینهٔ خودمیزبان (سختافزار مالکیتی) | صرفهجویی ماهانه |
|---|---|---|---|
| ۱۰۰ میلیون توکن | ۱٬۷۵۰ دلار | ۵٬۵۰۰ دلار | -۳٬۷۵۰ دلار (زیان) |
| ۵۰۰ میلیون توکن | ۸٬۷۵۰ دلار | ۷٬۵۰۰ دلار | ۱٬۲۵۰ دلار (بازگشت ۲۰ ماهه) |
| ۱ میلیارد توکن | ۱۷٬۵۰۰ دلار | ۱۰٬۰۰۰ دلار | ۷٬۵۰۰ دلار (بازگشت ۷ ماهه) |
| ۵ میلیارد توکن | ۸۷٬۵۰۰ دلار | ۲۵٬۰۰۰ دلار | ۶۲٬۵۰۰ دلار (بازگشت ۱ ماهه) |
در مقابل یک API پیشرو و ممتاز که حدود ۱٬۷۵۰ دلار برای هر ۱۰۰ میلیون توکن میگیرد، نقطهٔ تلاقی حدود نیم تا یک میلیارد توکن در ماه قرار میگیرد، و بازگشت سرمایه از آنجا بهشدت شتاب میگیرد.
اما اگر جایگزین یک API ارزانقیمت باشید که نزدیک به ۸۰ دلار برای هر ۱۰۰ میلیون توکن میگیرد، محاسبه معکوس میشود: برای سربهسر شدن به بیش از ۵۰ میلیارد توکن در ماه نیاز دارید — حجمی که یک کلاستر جدی چند-GPU و یک تیم زیرساخت اختصاصی میطلبد. اگر یک API ارزان معیار کیفیت شما را برآورده کند، خودمیزبانی در هر حجمی که یک کسبوکار کوچک به آن میرسد بهندرت از نظر مالی منطقی است.
بهرهبرداری همهچیز است
تفکیکهای هزینهٔ دیگر نقطهٔ سربهسر را بسیار پایینتر میگذارند — یک مدل دقیق ساخت-در-برابر-اجاره آن را نزدیک ۴٬۲۰۰ دلار در ماه هزینهٔ API قرار میدهد — و فاصلهٔ میان برآوردها خودش درس است: هیچ نقطهٔ سربهسر جهانشمولی وجود ندارد. کل محاسبه به بهرهبرداری گره خورده است. یک GPU که ترافیک یکنواختی در تمام شبانهروز سرو میکند هزینهٔ ثابتش را روی میلیاردها توکن پخش میکند. همان GPU که ترافیک پرشدار روزانه را سرو میکند تمام شب بیکار میماند، بدون هیچ دستاوردی مستهلک میشود، و ساعتهای بیکاری بیسروصدا هزینهٔ واقعی هر توکن شما را دو یا سه برابر میکند.
پیش از اعتماد به هر رقم سربهسری، از جمله رقم این مقاله، شکل ترافیک خودتان را بسنجید: توکن بر ثانیهٔ پایدار، نسبت اوج به میانگین، و شیب رشد. حجم یکنواخت، قابل پیشبینی و روبهرشد به نفع خودمیزبانی است. حجم پرشدار یا کم به نفع هزینهٔ بیکاری صفرِ API است.
چرا vLLM خط را جابهجا کرد
پشتهٔ سرویسدهی که انتخاب میکنید یک متغیر مالی است، نه صرفاً فنی. توان عملیاتی هر GPU تعیین میکند چند GPU باید بخرید، و فاصلهٔ میان یک حلقهٔ سرویسدهی سادهلوحانه و یک موتور استنتاج مدرن بسیار زیاد است.
vLLM از طریق دو تکنیک که بهصورت پیشفرض فعال ارائه میشوند به انتخاب پیشفرض تولید تبدیل شده است:
- دستهبندی پیوسته هر شکاف GPU را با مخلوط کردن درخواستهای جدید و در جریان پر نگه میدارد بهجای انتظار برای پایان یک دستهٔ کامل، و توان عملیاتی را حدود ۲ تا ۳ برابر نسبت به دستهبندی ایستا بالا میبرد.
- PagedAttention حافظهٔ نهان کلید-مقدار را در بلوکها مدیریت میکند بهجای پیشتخصیص حافظهٔ پیوسته، و اتلاف ناشی از تکهتکه شدن را کم و از ۲ تا ۴ برابر درخواست همزمان بیشتر روی همان کارت پشتیبانی میکند.
vLLM در ترکیب با موازیسازی تانسوری روی GPUها و پشتیبانی از وزنهای کوانتیزه، حدود ۲۴ برابر توان عملیاتی یک حلقهٔ سرویسدهی سادهلوحانهٔ transformers را فراهم میکند — یعنی تقریباً ۲۴ برابر GPU کمتر برای همان ترافیک. کلاستری که بدون این تکنیکها اندازهبندی شود نه فقط کندتر است؛ بلکه یک اشتباه در هزینهٔ سرمایهای است.
دو ویژگی دیگر برای توجیه تجاری اهمیت دارد. نخست، vLLM نقاط پایانی سازگار با OpenAI ارائه میدهد، بنابراین مهاجرت بخش عمدهٔ ترافیک از یک API عمدتاً تغییر یک URL و کلید است نه بازنویسی — هزینهٔ تغییر پایین میماند. دوم، محدودیت: شما فقط میتوانید مدلهای با وزن باز مانند Llama، Qwen و DeepSeek و Mistral را خودمیزبان کنید. مدلهای پیشرو از آزمایشگاههای بزرگ فقط از طریق API در دسترس میمانند، و همین دلیل آن است که حالت پایانی رایج یک حالت ترکیبی است: خودمیزبانی یک مدل باز برای ۸۰ درصد ترافیک که روتین است، و همچنان مسیریابی ۲۰ درصدی که به استدلال پیشرو نیاز دارد از طریق یک API.
وقتی خودمیزبان میشوید چه چیزی در دفاترتان تغییر میکند
روزی که سرورهای GPU میرسند، حسابداری شما در پنج جا تغییر میکند. اینها را درست انجام دهید تا محاسبهٔ سربهسری که اجرا کردید واقعاً در صورتهای مالیتان ظاهر شود.
۱. سختافزار به دارایی ثابت تبدیل میشود
سرورهای GPU خریداریشده دارایی سرمایهای هستند، نه ملزومات. شما قیمت خرید بهعلاوهٔ هزینههای مستقیم بهکارگیری کلاستر — کرایه حمل، نصب رک، دستمزد پیکربندی اولیه — را بهعنوان دارایی ثابت روی ترازنامه ثبت میکنید، سپس آن را مستهلک میکنید. کامپیوترها و تجهیزات مرتبط عموماً دارایی MACRS ۵ ساله هستند، و استهلاک از زمانی آغاز میشود که دارایی در خدمت قرار میگیرد (آماده و در دسترس برای کاربرد مورد نظرش)، نه زمانی که صورتحساب را پرداخت میکنید.
بندر امن حداقلی ۲٬۵۰۰ دلاری که به شما اجازه میدهد خریدهای کوچک را هزینه کنید یک سرور GPU را پوشش نمیدهد. یک کلاستر ۶۰٬۰۰۰ دلاری را از حساب ملزومات اداری نگذرانید.
۲. در ۲۰۲۶ یک انتخاب واقعی زمانبندی مالیاتی دارید
برای مالیات فدرال، قانون جاری سه سرعت برای همان سختافزار به شما میدهد:
- هزینهکردن مادهٔ ۱۷۹: کسر تا ۲٬۵۶۰٬۰۰۰ دلار از تجهیزات واجد شرایط قرارگرفته در خدمت در ۲۰۲۶، با مزیت که بهازای هر دلار کم میشود تا زمانی که کل خریدهای واجد شرایط از ۴٬۰۹۰٬۰۰۰ دلار فراتر رود. کسر نمیتواند از درآمد مشمول مالیات کسبوکار شما بیشتر شود، اما مبالغ استفادهنشده به جلو منتقل میشود.
- استهلاک پاداش ۱۰۰ درصدی: بهصورت دائمی برای داراییهای واجد شرایط تحصیلشده پس از ۱۹ ژانویهٔ ۲۰۲۵ احیا شده است. برخلاف مادهٔ ۱۷۹، میتواند زیان ایجاد کند و سقف دلاری ندارد.
- MACRS عادی: کسر را روی ۵ سال پخش کنید.
یک کسبوکار کوچک سودده که اولین کلاستر خود را میخرد اغلب کل آن را در سال اول هزینه میکند. یک استارتاپ پیش از سوددهی ممکن است MACRS را ترجیح دهد و کسرها را برای سالهایی نگه دارد که درآمدی برای جبران وجود دارد. در هر صورت، استهلاک دفتری و مالیاتی را جداگانه پیگیری کنید — صورتهای مالی شما باید واقعیت اقتصادی را در طول عمر مفید دارایی منعکس کند حتی وقتی اظهارنامهٔ مالیاتی همه را یکجا میگیرد.
۳. GPUهای اجارهای هزینهٔ عملیاتی میمانند
هیچکدام از موارد بالا در صورت اجارهٔ GPUهای ابری بهصورت ساعتی اعمال نمیشود. اجارههای ساعتی، نمونههای رزروشده، و اشتراکهای ابری GPU هزینههای عملیاتی دورهای هستند — نزدیکتر به مسیر API تا به مالکیت. این یک راه میانی مشروع است (بدون سرمایهٔ پیشپرداخت، همچنان مصرفی)، اما از یک صورتحساب اجاره انتظار دارایی ترازنامهای یا کسر استهلاک نداشته باشید. تصمیم CapEx در برابر OpEx و تصمیم ساخت در برابر خرید دو محور جداگانه هستند.
۴. هزینههای جاری کلاستر میان بهای تمامشدهٔ کالای فروختهشده و هزینهٔ عملیاتی تقسیم میشود
پس از راهاندازی، هزینهها را بر اساس آنچه پشتیبانی میکنند طبقهبندی کنید:
- به بهای تمامشدهٔ کالای فروختهشده (که با سرو کردن مشتریان بالا میروند): برق گرههای تولیدی، هممکانی و پهنای باند برای کلاستر سرویسدهی، پایش و ثبت وقایع تولید، و استهلاک GPUهای تولیدی.
- به هزینهٔ عملیاتی: جعبهٔ نمونهاولیهای که مهندسان شما روی آن آزمایش میکنند، محیطهای آمادهسازی، و زیرساخت عمومی تحقیق و توسعه.
همین تقسیم برای نیروی کار هم اعمال میشود. زمان مهندسی صرفشده برای بالا نگه داشتن استنتاج تولید، تحویل را پشتیبانی میکند و میتواند در بهای تمامشدهٔ کالای فروختهشده بنشیند؛ زمان صرفشده برای ارزیابی مدل سهماههٔ بعد تحقیق و توسعه است. حاشیهٔ سود ناخالص SaaS معمولاً بین ۷۰ تا ۸۵ درصد معیارگذاری میشود، و طبقهبندی نادرست در هر جهت حاشیهٔ شما را غیرقابلمقایسه میکند — هزینهٔ API و میزبانی را در سربار بگذارید و حاشیهٔ شما بهطور مصنوعی شگفتانگیز به نظر میرسد درحالیکه OpEx شما متورم به نظر میآید.
۵. حاشیهٔ سود ناخالص شما باید پس از سربهسر گسترش یابد
این همانی را ماهانه پس از مهاجرت زیر نظر بگیرید: خط API در بهای تمامشدهٔ کالای فروختهشده باید بهسمت صفر کاهش یابد (یا در یک چیدمان ترکیبی بهسمت باقیماندهٔ ۲۰ درصدی پیشرو)، و جای آن را رقم کوچکتر استهلاک بهعلاوهٔ میزبانی بگیرد. اگر حاشیهٔ سود ناخالص در یک یا دو فصل پس از عملیات پایدار بهبود نیابد، یا بهرهبرداری کمتر از مدلسازی است یا هزینههای پنهان عملیاتی صرفهجویی را خوردهاند — و این علامتی است که باید تصمیم را بازبینی کنید نه اینکه از آن دفاع کنید.
در یک دفتر متنی ساده، خودِ خرید یک قید متوازن است — تبدیلی داراییمحور از نقد به تجهیزات، با قیدهای استهلاک که هزینه را ماهبهماه شناسایی میکنند. اگر هرگز داراییهای ثابت را به این شکل مدلسازی نکردهاید، مستندات Beancount حسابها، ثبتهای استهلاک و گزارشها را گامبهگام توضیح میدهد.
اشتباهاتی که صرفهجویی را پاک میکنند
بیشتر مهاجرتهای خودمیزبانی ناموفق روی معیارهای GPU شکست نمیخورند. روی هزینههایی که صفحهٔ گسترده از آنها غافل شده شکست میخورند:
اندازهبندی برای اوج، پرداخت برای میانگین. کلاستری که برای شلوغترین ساعتها تأمین شود، بقیهٔ روز نیمهخالی میماند. هر ساعت بیکاری استهلاک است با صفر توکن. مقیاسپذیری خودکار روی GPUهای اجارهای کمک میکند؛ روی سختافزار مالکیتی، تنها راهحل حجم پایهٔ کافی است.
فراموش کردن دنبالهٔ عملیات. یک شکافت دقیق هزینههای پنهان ماهانه را ۴٬۷۰۰ تا ۷٬۹۰۰ دلار روی سختافزار برای یک چیدمان ۴-GPU فروتن میگذارد: ۸ تا ۲۰ ساعت مهندسی در ماه (۲٬۵۰۰ تا ۵٬۰۰۰ دلار با دستمزد کامل)، برق (۴۰۰ تا ۶۰۰ دلار)، شبکه و ذخیرهسازی، پایش، و یک یدکی افزونه. هیچکدام در مقایسهٔ قیمت GPU ظاهر نمیشوند.
نادیده گرفتن شکاف زمان کارکرد. ارائهدهندگان API معمولاً ۹۹٫۹ درصد زمان کارکرد بر اساس SLA را تضمین میکنند. یک کلاستر خودگردان بدون سرمایهگذاری جدی در افزونگی، بهطور واقعبینانه به ۹۵ تا ۹۹ درصد میرسد — کارتهای خراب، فروپاشیهای کمبود حافظه، بهروزرسانی درایور CUDA که استقرار را در ساعت ۲ بامداد میشکند. روی ۱۰۰٬۰۰۰ دلار درآمد ماهانهٔ مبتنی بر هوش مصنوعی، یک نقطهٔ اضافه خرابی ماهانه ۱٬۰۰۰ دلار هزینه دارد، پیش از محاسبهٔ پاسخ به حادثه.
ثبت هزینهٔ API بهعنوان سربار. اگر هزینههای استنتاج در هزینههای عمومی بنشیند نه بهای تمامشدهٔ کالای فروختهشده، حاشیهٔ سود ناخالص شما در هر دو جهت داستان است: پیش از مهاجرت بیشازاندازه، و بهبود پس از مهاجرت نامرئی. طبقهبندی را پیش از مقایسه درست کنید.
خوشبینی در عمر مفید. برخی ابرمقیاسها GPUها را روی ۵ تا ۶ سال مستهلک میکنند درحالیکه تحلیلگران میگویند عمر اقتصادی نزدیک به ۲ تا ۳ سال است با توجه به سرعتی که هر نسل قبلی را از رده خارج میکند. اگر ارزش بازفروش کلاستر شما با عرضهٔ معماری بعدی فروبپاشد، بهجای حمل یک دارایی خیالی کاهش ارزش را ثبت کنید.
مخلوط کردن هزینهٔ نمونهٔ اولیه با تولید. GPUی که برای ارزیابی تنظیم دقیق خریدید تحقیق و توسعه است. کلاستری که ترافیک مشتری را سرو میکند تولید است. مخلوط کردن آنها در یک حساب، هم حاشیهٔ سود ناخالص و هم پشتوانهٔ اعتبار تحقیق و توسعهٔ شما را خراب میکند.
یک فهرست تصمیم پیش از خرید
این شش پرسش را با اعداد واقعی مرور کنید، نه بر اساس حس درونی:
۱. حجم: آیا هزینهٔ ماهانهٔ پایدار API بالای حدود ۲۰٬۰۰۰ دلار است، یا بهطور معتبری در دو فصل آینده به آنجا میرسد؟ ۲. کدام API را جایگزین میکنید؟ قیمت پیشرو و ممتاز نزدیک یک میلیارد توکن در ماه سربهسر میشود؛ قیمت API ارزانقیمت شاید هرگز سربهسر نشود. ۳. شکل ترافیک: آیا بار آنقدر یکنواخت است که GPUها مشغول بمانند، یا تأمین اوج ظرفیت را بیاستفاده رها میکند؟ ۴. تخصص: آیا کسی در تیم از قبل CUDA و کوانتیزاسیون و تنظیم vLLM را میداند — یا دارید یک استخدام را در محاسبهٔ بازگشت سرمایه لحاظ میکنید؟ ۵. نقدینگی و مالیات: آیا میتوانید سرمایهٔ پیشپرداخت را تأمین کنید، و آیا درآمدی دارید که کسر مادهٔ ۱۷۹ یا استهلاک پاداش را به کار ببرید — یا MACRS برای شما بهتر عمل میکند؟ ۶. محرکهای غیرمالی: آیا نیازهای حفظ حریم خصوصی، انطباق، یا تأخیر زیر ۱۰۰ میلیثانیه خودمیزبانی را فارغ از هزینه الزامی میکند؟
سه پاسخ ضعیف یا بیشتر به این معناست که فعلاً روی API بمانید (یا تقسیم ترکیبی). خط هنوز آنجا خواهد بود وقتی حجم شما به آن میرسد — و تا آن زمان، نسل بعدی GPU آن را به نفع شما جابهجا کرده است.
هزینهٔ استنتاج خود را خوانا نگه دارید
چه بهازای هر توکن پرداخت کنید چه بر اساس برنامهٔ استهلاک، استنتاج اکنون یکی از بزرگترین خطوط هزینهٔ شماست، و سزاوار بهتر از یک جمعیت مرموز یکتکه در صورت سود و زیان است. جدا کردن هزینهٔ API از میزبانی، GPUهای تولیدی از جعبههای نمونهٔ اولیه، و استهلاک دفتری از استهلاک مالیاتی آن چیزی است که خط سربهسر را از یک محاسبهٔ یکباره به عددی تبدیل میکند که میتوانید هر ماه تماشا کنید.
Beancount.io حسابداری متنی سادهای فراهم میکند که به شما شفافیت و کنترل کامل روی دادههای مالیتان میدهد — بدون جعبهٔ سیاه، بدون وابستگی به فروشنده. کلاستر را بهعنوان دارایی ثابت ردیابی کنید، استهلاک را طبق زمانبندی ثبت کنید، و بگذارید در گزارشهایتان در Fava جاری شود. رایگان شروع کنید و هزینهٔ زیرساخت هوش مصنوعی خود را بهخوانایی کد زیرساختتان نگه دارید.
