پرش به محتوای اصلی

خط سربه‌سر GPU: زمانی که یک کلاستر vLLM خودمیزبان از هزینهٔ API مدل زبانی بزرگ پیشی می‌گیرد

منتشر شده زمان مطالعه 14 دقیقهMike ThriftMike Thrift
خط سربه‌سر GPU: زمانی که یک کلاستر vLLM خودمیزبان از هزینهٔ API مدل زبانی بزرگ پیشی می‌گیرد
فهرست مطالب این صفحه

صورت‌حساب API شما دقیقاً هم‌گام با موفقیتتان رشد می‌کند. هر مشتری جدید توکن‌ها را افزایش می‌دهد، هر توکن هزینه را بیشتر می‌کند، و کل این مبلغ هر ماه در بهای تمام‌شدهٔ کالای فروخته‌شدهٔ شما می‌نشیند. در حجمی مشخص، آن صورت‌حساب مصرفی از یک خط عبور می‌کند: خرید مستقیم GPU‌ها و اجرای خودِ استنتاج ارزان‌تر از اجارهٔ متعلق به دیگری می‌شود. پرسش اینجاست که آن خط برای شما کجاست — چون عبور از آن تنها یک تصمیم مهندسی نیست. ترازنامه، حاشیهٔ سود ناخالص و اظهارنامهٔ مالیاتی شما را از نو می‌نویسد.

این راهنما محاسبهٔ سربه‌سر، این‌که چرا پشتهٔ سرویس‌دهی vLLM این خط را جابه‌جا کرد، و این‌که روزی که هزینهٔ فراخوانی‌های API را متوقف و کلاستر GPU را سرمایه‌ای می‌کنید چه چیزی در دفاترتان تغییر می‌کند را توضیح می‌دهد.

دو راه برای پرداخت هزینهٔ استنتاج​

هر توکنی که محصول شما سرو می‌کند به یکی از دو صورت پرداخت می‌شود، و این دو کاملاً متفاوت بر صورت‌های مالی شما اثر می‌گذارند.

مسیر API هزینهٔ عملیاتی خالص است. شما به‌ازای هر میلیون توکن پرداخت می‌کنید، صورت‌حساب با میزان مصرف بالا می‌رود، و کل مبلغ یک هزینهٔ دوره‌ای است — به‌طور طبیعی‌تر به‌عنوان بهای تمام‌شدهٔ کالای فروخته‌شده ثبت می‌شود، چون استنتاج مستقیماً به تحویل محصول شما به مشتریان گره خورده است. بدون پیش‌پرداخت، بدون دارایی، بدون استهلاک. حاشیهٔ سود ناخالص شما هر ماه با نرخی ثابت ضربه می‌خورد، هرچقدر هم که بزرگ شوید.

مسیر خودمیزبانی عمدتاً هزینهٔ سرمایه‌ای است. شما سرورهای GPU را می‌خرید (یا قراردادی بلندمدت امضا می‌کنید)، دارایی ثابتی روی ترازنامه می‌گذارید، و آن را در طول عمر مفیدش مستهلک می‌کنید. صورت سود و زیان ماهانهٔ شما سپس استهلاک به‌علاوهٔ هزینه‌های عملیاتی — برق، جایگاه رک یا هم‌مکانی، پایش، و ساعت‌های مهندسی که کلاستر را سالم نگه می‌دارد — را به‌جای صورتحساب هر توکن نشان می‌دهد.

این تفاوت ساختاری تمام ماجراست. هزینه‌های API برای همیشه به‌صورت خطی با حجم بالا می‌روند. هزینه‌های خودمیزبانی پیش‌پرداخت‌شده و عمدتاً ثابت‌اند، بنابراین هزینهٔ مؤثر هر توکن با افزایش بهره‌برداری کاهش می‌یابد. جایی این دو منحنی یکدیگر را قطع می‌کنند. تمام مطلب زیر دربارهٔ یافتن آن نقطه است.

محاسبهٔ سربه‌سر​

تحلیلی پراستناد در ۲۰۲۶ بر بیش از ۵۰ استقرار تولیدی، قاعدهٔ سرانگشتی را حدود ۲۰٬۰۰۰ دلار در ماه هزینهٔ API تعیین کرد. پایین‌تر از آن، هزینهٔ مهندسی و عملیات اجرای کلاستر خودتان تقریباً همیشه از صرفه‌جویی بیشتر است. بالای ۵۰٬۰۰۰ دلار در ماه، خودمیزبانی بخش عمدهٔ ترافیک معمولاً با برتری ۵۰ تا ۷۰ درصدی پیروز می‌شود. بین این دو خط، منطقهٔ خاکستری قرار دارد که جزئیات — مدل‌های شما، شکل ترافیکتان، تجربهٔ GPU تیم‌تان — تصمیم می‌گیرند.

همان تحلیل سرمایه‌گذاری پشت این اعداد را ترسیم کرد: ۵۰٬۰۰۰ تا ۵۰۰٬۰۰۰ دلار پیش‌پرداخت برای سخت‌افزار GPU بسته به اندازهٔ مدل، به‌علاوهٔ ۳٬۰۰۰ تا ۱۵٬۰۰۰ دلار در ماه هزینهٔ عملیات جاری. این دامنه از یک جعبهٔ کلاس A100 دست‌دوم برای سرو کردن یک مدل ۷۰ میلیارد پارامتری تا یک کلاستر چندگره‌ای H100 را در برمی‌گیرد.

اینکه کدام API را جایگزین می‌کنید اهمیت بسیاری دارد​

حجم سربه‌سر بسته به آن‌که امروز به‌ازای هر توکن چقدر می‌پردازید حدود ۱۰۰ برابر جابه‌جا می‌شود:

حجم ماهانههزینهٔ API پیشرو (تقریبی)هزینهٔ خودمیزبان (سخت‌افزار مالکیتی)صرفه‌جویی ماهانه
۱۰۰ میلیون توکن۱٬۷۵۰ دلار۵٬۵۰۰ دلار-۳٬۷۵۰ دلار (زیان)
۵۰۰ میلیون توکن۸٬۷۵۰ دلار۷٬۵۰۰ دلار۱٬۲۵۰ دلار (بازگشت ۲۰ ماهه)
۱ میلیارد توکن۱۷٬۵۰۰ دلار۱۰٬۰۰۰ دلار۷٬۵۰۰ دلار (بازگشت ۷ ماهه)
۵ میلیارد توکن۸۷٬۵۰۰ دلار۲۵٬۰۰۰ دلار۶۲٬۵۰۰ دلار (بازگشت ۱ ماهه)

در مقابل یک API پیشرو و ممتاز که حدود ۱٬۷۵۰ دلار برای هر ۱۰۰ میلیون توکن می‌گیرد، نقطهٔ تلاقی حدود نیم تا یک میلیارد توکن در ماه قرار می‌گیرد، و بازگشت سرمایه از آن‌جا به‌شدت شتاب می‌گیرد.

اما اگر جایگزین یک API ارزان‌قیمت باشید که نزدیک به ۸۰ دلار برای هر ۱۰۰ میلیون توکن می‌گیرد، محاسبه معکوس می‌شود: برای سربه‌سر شدن به بیش از ۵۰ میلیارد توکن در ماه نیاز دارید — حجمی که یک کلاستر جدی چند-GPU و یک تیم زیرساخت اختصاصی می‌طلبد. اگر یک API ارزان معیار کیفیت شما را برآورده کند، خودمیزبانی در هر حجمی که یک کسب‌وکار کوچک به آن می‌رسد به‌ندرت از نظر مالی منطقی است.

بهره‌برداری همه‌چیز است​

تفکیک‌های هزینهٔ دیگر نقطهٔ سربه‌سر را بسیار پایین‌تر می‌گذارند — یک مدل دقیق ساخت-در-برابر-اجاره آن را نزدیک ۴٬۲۰۰ دلار در ماه هزینهٔ API قرار می‌دهد — و فاصلهٔ میان برآوردها خودش درس است: هیچ نقطهٔ سربه‌سر جهان‌شمولی وجود ندارد. کل محاسبه به بهره‌برداری گره خورده است. یک GPU که ترافیک یکنواختی در تمام شبانه‌روز سرو می‌کند هزینهٔ ثابتش را روی میلیاردها توکن پخش می‌کند. همان GPU که ترافیک پرش‌دار روزانه را سرو می‌کند تمام شب بیکار می‌ماند، بدون هیچ دستاوردی مستهلک می‌شود، و ساعت‌های بیکاری بی‌سروصدا هزینهٔ واقعی هر توکن شما را دو یا سه برابر می‌کند.

پیش از اعتماد به هر رقم سربه‌سری، از جمله رقم این مقاله، شکل ترافیک خودتان را بسنجید: توکن بر ثانیهٔ پایدار، نسبت اوج به میانگین، و شیب رشد. حجم یکنواخت، قابل پیش‌بینی و روبه‌رشد به نفع خودمیزبانی است. حجم پرش‌دار یا کم به نفع هزینهٔ بیکاری صفرِ API است.

چرا vLLM خط را جابه‌جا کرد​

پشتهٔ سرویس‌دهی که انتخاب می‌کنید یک متغیر مالی است، نه صرفاً فنی. توان عملیاتی هر GPU تعیین می‌کند چند GPU باید بخرید، و فاصلهٔ میان یک حلقهٔ سرویس‌دهی ساده‌لوحانه و یک موتور استنتاج مدرن بسیار زیاد است.

vLLM از طریق دو تکنیک که به‌صورت پیش‌فرض فعال ارائه می‌شوند به انتخاب پیش‌فرض تولید تبدیل شده است:

  • دسته‌بندی پیوسته هر شکاف GPU را با مخلوط کردن درخواست‌های جدید و در جریان پر نگه می‌دارد به‌جای انتظار برای پایان یک دستهٔ کامل، و توان عملیاتی را حدود ۲ تا ۳ برابر نسبت به دسته‌بندی ایستا بالا می‌برد.
  • PagedAttention حافظهٔ نهان کلید-مقدار را در بلوک‌ها مدیریت می‌کند به‌جای پیش‌تخصیص حافظهٔ پیوسته، و اتلاف ناشی از تکه‌تکه شدن را کم و از ۲ تا ۴ برابر درخواست هم‌زمان بیشتر روی همان کارت پشتیبانی می‌کند.

vLLM در ترکیب با موازی‌سازی تانسوری روی GPUها و پشتیبانی از وزن‌های کوانتیزه، حدود ۲۴ برابر توان عملیاتی یک حلقهٔ سرویس‌دهی ساده‌لوحانهٔ transformers را فراهم می‌کند — یعنی تقریباً ۲۴ برابر GPU کمتر برای همان ترافیک. کلاستری که بدون این تکنیک‌ها اندازه‌بندی شود نه فقط کندتر است؛ بلکه یک اشتباه در هزینهٔ سرمایه‌ای است.

دو ویژگی دیگر برای توجیه تجاری اهمیت دارد. نخست، vLLM نقاط پایانی سازگار با OpenAI ارائه می‌دهد، بنابراین مهاجرت بخش عمدهٔ ترافیک از یک API عمدتاً تغییر یک URL و کلید است نه بازنویسی — هزینهٔ تغییر پایین می‌ماند. دوم، محدودیت: شما فقط می‌توانید مدل‌های با وزن باز مانند Llama، Qwen و DeepSeek و Mistral را خودمیزبان کنید. مدل‌های پیشرو از آزمایشگاه‌های بزرگ فقط از طریق API در دسترس می‌مانند، و همین دلیل آن است که حالت پایانی رایج یک حالت ترکیبی است: خودمیزبانی یک مدل باز برای ۸۰ درصد ترافیک که روتین است، و همچنان مسیریابی ۲۰ درصدی که به استدلال پیشرو نیاز دارد از طریق یک API.

وقتی خودمیزبان می‌شوید چه چیزی در دفاترتان تغییر می‌کند​

روزی که سرورهای GPU می‌رسند، حسابداری شما در پنج جا تغییر می‌کند. این‌ها را درست انجام دهید تا محاسبهٔ سربه‌سری که اجرا کردید واقعاً در صورت‌های مالی‌تان ظاهر شود.

۱. سخت‌افزار به دارایی ثابت تبدیل می‌شود​

سرورهای GPU خریداری‌شده دارایی سرمایه‌ای هستند، نه ملزومات. شما قیمت خرید به‌علاوهٔ هزینه‌های مستقیم به‌کارگیری کلاستر — کرایه حمل، نصب رک، دستمزد پیکربندی اولیه — را به‌عنوان دارایی ثابت روی ترازنامه ثبت می‌کنید، سپس آن را مستهلک می‌کنید. کامپیوترها و تجهیزات مرتبط عموماً دارایی MACRS ۵ ساله هستند، و استهلاک از زمانی آغاز می‌شود که دارایی در خدمت قرار می‌گیرد (آماده و در دسترس برای کاربرد مورد نظرش)، نه زمانی که صورتحساب را پرداخت می‌کنید.

بندر امن حداقلی ۲٬۵۰۰ دلاری که به شما اجازه می‌دهد خریدهای کوچک را هزینه کنید یک سرور GPU را پوشش نمی‌دهد. یک کلاستر ۶۰٬۰۰۰ دلاری را از حساب ملزومات اداری نگذرانید.

۲. در ۲۰۲۶ یک انتخاب واقعی زمان‌بندی مالیاتی دارید​

برای مالیات فدرال، قانون جاری سه سرعت برای همان سخت‌افزار به شما می‌دهد:

  • هزینه‌کردن مادهٔ ۱۷۹: کسر تا ۲٬۵۶۰٬۰۰۰ دلار از تجهیزات واجد شرایط قرارگرفته در خدمت در ۲۰۲۶، با مزیت که به‌ازای هر دلار کم می‌شود تا زمانی که کل خریدهای واجد شرایط از ۴٬۰۹۰٬۰۰۰ دلار فراتر رود. کسر نمی‌تواند از درآمد مشمول مالیات کسب‌وکار شما بیشتر شود، اما مبالغ استفاده‌نشده به جلو منتقل می‌شود.
  • استهلاک پاداش ۱۰۰ درصدی: به‌صورت دائمی برای دارایی‌های واجد شرایط تحصیلشده پس از ۱۹ ژانویهٔ ۲۰۲۵ احیا شده است. برخلاف مادهٔ ۱۷۹، می‌تواند زیان ایجاد کند و سقف دلاری ندارد.
  • MACRS عادی: کسر را روی ۵ سال پخش کنید.

یک کسب‌وکار کوچک سودده که اولین کلاستر خود را می‌خرد اغلب کل آن را در سال اول هزینه می‌کند. یک استارتاپ پیش از سوددهی ممکن است MACRS را ترجیح دهد و کسرها را برای سال‌هایی نگه دارد که درآمدی برای جبران وجود دارد. در هر صورت، استهلاک دفتری و مالیاتی را جداگانه پیگیری کنید — صورت‌های مالی شما باید واقعیت اقتصادی را در طول عمر مفید دارایی منعکس کند حتی وقتی اظهارنامهٔ مالیاتی همه را یک‌جا می‌گیرد.

۳. GPUهای اجاره‌ای هزینهٔ عملیاتی می‌مانند​

هیچ‌کدام از موارد بالا در صورت اجارهٔ GPUهای ابری به‌صورت ساعتی اعمال نمی‌شود. اجاره‌های ساعتی، نمونه‌های رزروشده، و اشتراک‌های ابری GPU هزینه‌های عملیاتی دوره‌ای هستند — نزدیک‌تر به مسیر API تا به مالکیت. این یک راه میانی مشروع است (بدون سرمایهٔ پیش‌پرداخت، همچنان مصرفی)، اما از یک صورتحساب اجاره انتظار دارایی ترازنامه‌ای یا کسر استهلاک نداشته باشید. تصمیم CapEx در برابر OpEx و تصمیم ساخت در برابر خرید دو محور جداگانه هستند.

۴. هزینه‌های جاری کلاستر میان بهای تمام‌شدهٔ کالای فروخته‌شده و هزینهٔ عملیاتی تقسیم می‌شود​

پس از راه‌اندازی، هزینه‌ها را بر اساس آن‌چه پشتیبانی می‌کنند طبقه‌بندی کنید:

  • به بهای تمام‌شدهٔ کالای فروخته‌شده (که با سرو کردن مشتریان بالا می‌روند): برق گره‌های تولیدی، هم‌مکانی و پهنای باند برای کلاستر سرویس‌دهی، پایش و ثبت وقایع تولید، و استهلاک GPUهای تولیدی.
  • به هزینهٔ عملیاتی: جعبهٔ نمونه‌اولیه‌ای که مهندسان شما روی آن آزمایش می‌کنند، محیط‌های آماده‌سازی، و زیرساخت عمومی تحقیق و توسعه.

همین تقسیم برای نیروی کار هم اعمال می‌شود. زمان مهندسی صرف‌شده برای بالا نگه داشتن استنتاج تولید، تحویل را پشتیبانی می‌کند و می‌تواند در بهای تمام‌شدهٔ کالای فروخته‌شده بنشیند؛ زمان صرف‌شده برای ارزیابی مدل سهماههٔ بعد تحقیق و توسعه است. حاشیهٔ سود ناخالص SaaS معمولاً بین ۷۰ تا ۸۵ درصد معیارگذاری می‌شود، و طبقه‌بندی نادرست در هر جهت حاشیهٔ شما را غیرقابل‌مقایسه می‌کند — هزینهٔ API و میزبانی را در سربار بگذارید و حاشیهٔ شما به‌طور مصنوعی شگفت‌انگیز به نظر می‌رسد درحالی‌که OpEx شما متورم به نظر می‌آید.

۵. حاشیهٔ سود ناخالص شما باید پس از سربه‌سر گسترش یابد​

این همانی را ماهانه پس از مهاجرت زیر نظر بگیرید: خط API در بهای تمام‌شدهٔ کالای فروخته‌شده باید به‌سمت صفر کاهش یابد (یا در یک چیدمان ترکیبی به‌سمت باقیماندهٔ ۲۰ درصدی پیشرو)، و جای آن را رقم کوچک‌تر استهلاک به‌علاوهٔ میزبانی بگیرد. اگر حاشیهٔ سود ناخالص در یک یا دو فصل پس از عملیات پایدار بهبود نیابد، یا بهره‌برداری کمتر از مدل‌سازی است یا هزینه‌های پنهان عملیاتی صرفه‌جویی را خورده‌اند — و این علامتی است که باید تصمیم را بازبینی کنید نه این‌که از آن دفاع کنید.

در یک دفتر متنی ساده، خودِ خرید یک قید متوازن است — تبدیلی دارایی‌محور از نقد به تجهیزات، با قیدهای استهلاک که هزینه را ماه‌به‌ماه شناسایی می‌کنند. اگر هرگز دارایی‌های ثابت را به این شکل مدل‌سازی نکرده‌اید، مستندات Beancount حساب‌ها، ثبت‌های استهلاک و گزارش‌ها را گام‌به‌گام توضیح می‌دهد.

اشتباهاتی که صرفه‌جویی را پاک می‌کنند​

بیشتر مهاجرت‌های خودمیزبانی ناموفق روی معیارهای GPU شکست نمی‌خورند. روی هزینه‌هایی که صفحهٔ گسترده از آن‌ها غافل شده شکست می‌خورند:

اندازه‌بندی برای اوج، پرداخت برای میانگین. کلاستری که برای شلوغ‌ترین ساعتها تأمین شود، بقیهٔ روز نیمه‌خالی می‌ماند. هر ساعت بیکاری استهلاک است با صفر توکن. مقیاس‌پذیری خودکار روی GPUهای اجاره‌ای کمک می‌کند؛ روی سخت‌افزار مالکیتی، تنها راه‌حل حجم پایهٔ کافی است.

فراموش کردن دنبالهٔ عملیات. یک شکافت دقیق هزینه‌های پنهان ماهانه را ۴٬۷۰۰ تا ۷٬۹۰۰ دلار روی سخت‌افزار برای یک چیدمان ۴-GPU فروتن می‌گذارد: ۸ تا ۲۰ ساعت مهندسی در ماه (۲٬۵۰۰ تا ۵٬۰۰۰ دلار با دستمزد کامل)، برق (۴۰۰ تا ۶۰۰ دلار)، شبکه و ذخیره‌سازی، پایش، و یک یدکی افزونه. هیچ‌کدام در مقایسهٔ قیمت GPU ظاهر نمی‌شوند.

نادیده گرفتن شکاف زمان کارکرد. ارائه‌دهندگان API معمولاً ۹۹٫۹ درصد زمان کارکرد بر اساس SLA را تضمین می‌کنند. یک کلاستر خودگردان بدون سرمایه‌گذاری جدی در افزونگی، به‌طور واقع‌بینانه به ۹۵ تا ۹۹ درصد می‌رسد — کارت‌های خراب، فروپاشی‌های کمبود حافظه، به‌روزرسانی درایور CUDA که استقرار را در ساعت ۲ بامداد می‌شکند. روی ۱۰۰٬۰۰۰ دلار درآمد ماهانهٔ مبتنی بر هوش مصنوعی، یک نقطهٔ اضافه خرابی ماهانه ۱٬۰۰۰ دلار هزینه دارد، پیش از محاسبهٔ پاسخ به حادثه.

ثبت هزینهٔ API به‌عنوان سربار. اگر هزینه‌های استنتاج در هزینه‌های عمومی بنشیند نه بهای تمام‌شدهٔ کالای فروخته‌شده، حاشیهٔ سود ناخالص شما در هر دو جهت داستان است: پیش از مهاجرت بیش‌ازاندازه، و بهبود پس از مهاجرت نامرئی. طبقه‌بندی را پیش از مقایسه درست کنید.

خوش‌بینی در عمر مفید. برخی ابرمقیاس‌ها GPUها را روی ۵ تا ۶ سال مستهلک می‌کنند درحالی‌که تحلیل‌گران می‌گویند عمر اقتصادی نزدیک به ۲ تا ۳ سال است با توجه به سرعتی که هر نسل قبلی را از رده خارج می‌کند. اگر ارزش بازفروش کلاستر شما با عرضهٔ معماری بعدی فروبپاشد، به‌جای حمل یک دارایی خیالی کاهش ارزش را ثبت کنید.

مخلوط کردن هزینهٔ نمونهٔ اولیه با تولید. GPUی که برای ارزیابی تنظیم دقیق خریدید تحقیق و توسعه است. کلاستری که ترافیک مشتری را سرو می‌کند تولید است. مخلوط کردن آن‌ها در یک حساب، هم حاشیهٔ سود ناخالص و هم پشتوانهٔ اعتبار تحقیق و توسعهٔ شما را خراب می‌کند.

یک فهرست تصمیم پیش از خرید​

این شش پرسش را با اعداد واقعی مرور کنید، نه بر اساس حس درونی:

۱. حجم: آیا هزینهٔ ماهانهٔ پایدار API بالای حدود ۲۰٬۰۰۰ دلار است، یا به‌طور معتبری در دو فصل آینده به آن‌جا می‌رسد؟ ۲. کدام API را جایگزین می‌کنید؟ قیمت پیشرو و ممتاز نزدیک یک میلیارد توکن در ماه سربه‌سر می‌شود؛ قیمت API ارزان‌قیمت شاید هرگز سربه‌سر نشود. ۳. شکل ترافیک: آیا بار آن‌قدر یکنواخت است که GPUها مشغول بمانند، یا تأمین اوج ظرفیت را بی‌استفاده رها می‌کند؟ ۴. تخصص: آیا کسی در تیم از قبل CUDA و کوانتیزاسیون و تنظیم vLLM را می‌داند — یا دارید یک استخدام را در محاسبهٔ بازگشت سرمایه لحاظ می‌کنید؟ ۵. نقدینگی و مالیات: آیا می‌توانید سرمایهٔ پیش‌پرداخت را تأمین کنید، و آیا درآمدی دارید که کسر مادهٔ ۱۷۹ یا استهلاک پاداش را به کار ببرید — یا MACRS برای شما بهتر عمل می‌کند؟ ۶. محرک‌های غیرمالی: آیا نیازهای حفظ حریم خصوصی، انطباق، یا تأخیر زیر ۱۰۰ میلی‌ثانیه خودمیزبانی را فارغ از هزینه الزامی می‌کند؟

سه پاسخ ضعیف یا بیشتر به این معناست که فعلاً روی API بمانید (یا تقسیم ترکیبی). خط هنوز آن‌جا خواهد بود وقتی حجم شما به آن می‌رسد — و تا آن زمان، نسل بعدی GPU آن را به نفع شما جابه‌جا کرده است.

هزینهٔ استنتاج خود را خوانا نگه دارید​

چه به‌ازای هر توکن پرداخت کنید چه بر اساس برنامهٔ استهلاک، استنتاج اکنون یکی از بزرگ‌ترین خطوط هزینهٔ شماست، و سزاوار بهتر از یک جمعیت مرموز یک‌تکه در صورت سود و زیان است. جدا کردن هزینهٔ API از میزبانی، GPUهای تولیدی از جعبه‌های نمونهٔ اولیه، و استهلاک دفتری از استهلاک مالیاتی آن چیزی است که خط سربه‌سر را از یک محاسبهٔ یک‌باره به عددی تبدیل می‌کند که می‌توانید هر ماه تماشا کنید.

Beancount.io حسابداری متنی ساده‌ای فراهم می‌کند که به شما شفافیت و کنترل کامل روی داده‌های مالی‌تان می‌دهد — بدون جعبهٔ سیاه، بدون وابستگی به فروشنده. کلاستر را به‌عنوان دارایی ثابت ردیابی کنید، استهلاک را طبق زمان‌بندی ثبت کنید، و بگذارید در گزارش‌هایتان در Fava جاری شود. رایگان شروع کنید و هزینهٔ زیرساخت هوش مصنوعی خود را به‌خوانایی کد زیرساختتان نگه دارید.

منبع: https://beancount.io/fa/blog/2026/10/10/gpu-breakeven-line-self-hosted-vllm-vs-llm-api-cogs-guide

منتشر شده: ۱۸ مهر ۱۴۰۵

زمان مطالعه 9 دقیقه

برنامه‌های استهلاک GPU، توضیح داده شده: چگونه یک تخمین، حاشیه سود ۶۰ درصد را به زیان ۱ میلیارد دلاری تبدیل می‌کند

CoreWeave در سال ۲۰۲۵ درآمدی معادل ۵.۱۳ میلیارد دلار و حاشیه سود EBITDA…

depreciation
fixed-assets
زمان مطالعه 10 دقیقه

هزینه‌های API مدل‌های زبانی بزرگ، بهای تمام‌شده کالای فروش‌رفته هستند، نه هزینه سربار: راهنمای حاشیه سود ناخالص برای Wrapperهای هوش مصنوعی

استنتاج مدل‌های زبانی بزرگ (LLM) یک هزینه متغیر برای ارائه محصول شماست، نه…

cost-of-goods-sold
ai
زمان مطالعه 14 دقیقه

کارت گرافیک خود را در Vast.ai یا RunPod اجاره می‌دهید؟ چرا قبض برق و جدول استهلاک به Schedule C تعلق دارند، نه به قبض خدمات عمومی شخصی شما

درآمد اجاره GPU، درآمد تجاری Schedule C است: برق اندازه‌گیری‌شده را کسر کنید،…

side-hustle
tax-deductions
زمان مطالعه 9 دقیقه

بازپس‌گیری استهلاک توضیح داده شد: صورت‌حساب مالیاتی که هنگام فروش تجهیزات یا املاک مستهلک‌شده در انتظار شماست

بازپس‌گیری استهلاک، کسوراتی که قبلاً در هنگام فروش یک دارایی تجاری با سود…

depreciation
fixed-assets
زمان مطالعه 13 دقیقه

دست از ابر کشیدن و رفتن سراغ رک کولوکیشن؟ این جابهجایی برنامه استهلاک شما را تغییر میدهد، نه فقط صورتهای ماهانهتان

خروج از ابر به سمت رک کولوکیشن هزینه عملیاتی را به هزینه سرمایهای تبدیل میکند —…

depreciation
fixed-assets