당신의 API 청구서는 성공과 완벽하게 나란히 증가합니다. 신규 고객이 생길 때마다 토큰이 늘고, 토큰마다 비용이 붙으며, 그 전액이 매달 매출원가에 계상됩니다. 어느 정도 규모가 되면 그 종량제 청구서는 한계선을 넘습니다. GPU를 직접 사서 추론을 자체 운영하는 편이 남의 것을 임대하는 것보다 저렴해지는 것입니다. 문제는 그 한계선이 당신에게 어디에 위치하느냐입니다. 왜냐하면 그것을 넘는 것은 단순한 엔지니어링 결정이 아니기 때문입니다. 그것은 대차대조표와 매출총이익률, 그리고 세금 신고서를 다시 씁니다.
이 가이드는 손익분기 계산, vLLM 서빙 스택이 그 한계선을 어떻게 끌어내렸는지, 그리고 API 호출을 비용 처리하는 것을 멈추고 GPU 클러스터를 자본화하기 시작하는 날 장부에서 무엇이 바뀌는지를 살펴봅니다.
추론 비용을 지불하는 두 가지 방식
당신의 제품이 처리하는 모든 토큰은 두 가지 방식 중 하나로 지불되며, 이들은 재무제표에 완전히 다르게 반영됩니다.
API 경로는 순수한 운영비입니다. 백만 토큰당 지불하고, 청구서는 사용량에 따라 확대되며, 전액이 기간 비용입니다. 추론은 고객에게 제품을 전달하는 일과 직접 연결되므로 매출원가로 계상하는 것이 가장 자연스럽습니다. 초기 비용도, 자산도, 감가상각도 없습니다. 규모가 아무리 커져도 매출총이익률은 매달 일정한 비율로 타격을 받습니다.
자체 호스팅 경로는 대부분 자본적 지출입니다. GPU 서버를 구매하거나(또는 장기 예약 계약을 체결하고), 대차대조표에 고정자산을 계상하고, 내용연수에 걸쳐 감가상각합니다. 그런 다음 월 손익계산서에는 토큰당 청구서 대신 감가상각과 운영 비용 — 전력, 코로케이션 또는 랙 공간, 모니터링, 클러스터를 건강하게 유지하는 엔지니어링 시간 — 이 표시됩니다.
이 구조적 차이가 게임의 전부입니다. API 비용은 영원히 사용량에 비례해 선형으로 증가합니다. 자체 호스팅 비용은 선불로 집중되고 대부분 고정비이므로, 가동률이 올라갈수록 실질 토큰당 비용은 떨어집니다. 어딘가에서 이 두 곡선이 교차합니다. 아래의 모든 내용은 그 지점을 찾는 것에 관한 것입니다.
손익분기 계산
50개 이상의 실제 운영 배포를 분석한 2026년의 널리 인용되는 한 분석은 경험적 기준선을 대략 월 $20,000의 API 지출로 제시했습니다. 그 이하에서는 자체 클러스터를 운영하는 엔지니어링 및 운영 비용이 거의 항상 절감액을 초과합니다. 월 $50,000 이상이면 대부분의 트래픽을 자체 호스팅하는 것이 일반적으로 50~70퍼센트 더 유리합니다. 그 사이에는 세부 사항 — 모델, 트래픽 형태, 팀의 GPU 경험 — 이 결정을 좌우하는 회색 지대가 있습니다.
같은 분석은 그 수치 뒤에 있는 투자 규모도 개략적으로 제시했습니다. 모델 크기에 따라 GPU 하드웨어에 선불 $50,000~$500,000, 그리고 월 $3,000~$15,000의 지속적 운영비입니다. 이는 700억 개 매개변수 모델을 서빙하는 중고 A100급 박스 한 대에서부터 다중 노드 H100 클러스터에 이르기까지의 범위입니다.
어떤 API를 대체하느냐가 결정적으로 중요합니다
손익분기 사용량은 현재 토큰당 지불하는 금액에 따라 약 100배까지 달라집니다.
| 월 사용량 | 프런티어 API 비용 (대략) | 자체 호스팅 비용 (자체 하드웨어) | 월 절감액 |
|---|---|---|---|
| 1억 토큰 | $1,750 | $5,500 | -$3,750 (손실) |
| 5억 토큰 | $8,750 | $7,500 | $1,250 (20개월 회수) |
| 10억 토큰 | $17,500 | $10,000 | $7,500 (7개월 회수) |
| 50억 토큰 | $87,500 | $25,000 | $62,500 (1개월 회수) |
1억 토큰당 약 $1,750를 청구하는 프리미엄 프런티어 API와 비교하면 교차점은 월 5억~10억 토큰 부근에 위치하며, 그 이후로는 회수 속도가 급격히 빨라집니다.
그러나 1억 토큰당 약 $80를 청구하는 저가 API를 대체한다면 계산이 뒤집힙니다. 손익분기를 맞추려면 월 500억 토큰 이상이 필요하며, 이는 본격적인 다중 GPU 클러스터와 전담 인프라 팀을 요구하는 규모입니다. 저렴한 API가 품질 기준을 충족한다면, 소규모 사업체가 도달할 어떤 규모에서도 자체 호스팅은 재무적으로 거의 타당하지 않습니다.
가동률이 전부입니다
다른 비용 분석에서는 손익분기점이 훨씬 낮게 나옵니다. 한 상세한 자체 구축 대 임대 모델은 월 약 $4,200의 API 지출 부근으로 제시하며, 추정치들 사이의 격차 자체가 교훈입니다. 보편적인 손익분기점은 존재하지 않습니다. 전체 계산은 가동률에 달려 있습니다. 24시간 꾸준한 트래픽을 처리하는 GPU는 고정비를 수십억 개의 토큰에 분산합니다. 같은 GPU가 낮 시간대에만 몰리는 트래픽을 처리하면 밤새 유휴 상태로 있으면서 아무 성과 없이 감가상각되며, 유휴 시간은 실제 토큰당 비용을 조용히 두 배 또는 세 배로 만듭니다.
이 글의 수치를 포함해 누구의 손익분기 수치를 믿기 전에, 자신의 트래픽 형태를 측정하십시오. 지속적인 초당 토큰 수, 최대 대 평균 비율, 성장 기울기입니다. 평탄하고 예측 가능하며 증가하는 사용량은 자체 호스팅에 유리합니다. 변동이 심하거나 사용량이 적으면 유휴 비용이 없는 API가 유리합니다.
vLLM이 한계선을 끌어내린 이유
선택하는 서빙 스택은 단순한 기술적 변수가 아니라 재무적 변수입니다. GPU당 처리량이 얼마나 많은 GPU를 사야 하는지를 결정하며, 단순한 서빙 루프와 최신 추론 엔진 사이의 격차는 엄청납니다.
vLLM은 기본적으로 활성화되어 제공되는 두 가지 기법을 통해 사실상의 프로덕션 표준이 되었습니다.
- 연속 배칭(continuous batching) 은 전체 배치가 끝나기를 기다리는 대신 새 요청과 처리 중인 요청을 섞어 모든 GPU 슬롯을 채워, 정적 배칭 대비 처리량을 약 2~3배 끌어올립니다.
- PagedAttention은 연속 메모리를 미리 할당하는 대신 키-값 캐시를 블록 단위로 관리하여 단편화 낭비를 줄이고 같은 카드에서 2~4배 더 많은 동시 요청을 지원합니다.
GPU 간 텐서 병렬 처리와 양자화 가중치 지원을 결합하면, vLLM은 단순한 transformers 서빙 루프 대비 약 24배의 처리량을 제공합니다. 즉, 같은 트래픽을 위해 구매해야 할 GPU가 약 24분의 1로 줄어듭니다. 이러한 기법 없이 산정된 클러스터는 단지 느린 것이 아니라 자본적 지출의 실수입니다.
비즈니스 사례와 관련해 두 가지 속성이 더 중요합니다. 첫째, vLLM은 OpenAI 호환 엔드포인트를 노출하므로, 대량 트래픽을 API에서 옮기는 것은 재작성이 아니라 대부분 URL과 키 변경에 불과합니다. 전환 비용이 낮게 유지됩니다. 둘째, 제약 사항입니다. 오픈 가중치 모델, 예컨대 Llama, Qwen, DeepSeek, Mistral만 자체 호스팅할 수 있습니다. 대형 연구소의 프런티어 모델은 API 전용으로 남으며, 이것이 일반적인 최종 형태가 하이브리드인 이유입니다. 일상적인 트래픽 80퍼센트는 오픈 모델로 자체 호스팅하고, 프런티어 추론이 필요한 20퍼센트는 계속 API로 라우팅하는 것입니다.
자체 호스팅 시 장부에서 바뀌는 것
GPU 서버가 도착하는 날, 회계는 다섯 곳에서 바뀝니다. 이를 올바르게 처리하면 당신이 계산한 손익분기 수치가 실제 재무제표에 나타납니다.
1. 하드웨어는 고정자산이 됩니다
구매한 GPU 서버는 소모품이 아니라 자본 자산입니다. 구매 가격에 클러스터를 가동 상태로 만드는 직접 비용 — 운송비, 랙 설치, 초기 구성 인건비 — 을 더한 금액을 대차대조표의 고정자산으로 계상한 뒤 감가상각합니다. 컴퓨터 및 관련 장비는 일반적으로 5년 MACRS 자산이며, 감가상각은 인보이스를 지불할 때가 아니라 자산이 사용 개시(placed in service) 될 때(의도된 용도로 사용할 준비가 되고 이용 가능할 때) 시작됩니다.
소액 구매를 비용 처리할 수 있게 하는 $2,500의 최소 안전항(de minimis safe harbor)은 GPU 서버를 감당하지 못합니다. $60,000짜리 클러스터를 사무용품으로 처리하지 마십시오.
2. 2026년에는 진정한 세무 시점 선택권이 있습니다
연방 세금의 경우, 현행 법은 같은 하드웨어에 대해 세 가지 속도를 제공합니다.
- 섹션 179 비용 처리: 2026년에 사용 개시된 적격 장비에 대해 최대 $2,560,000까지 공제하며, 총 적격 구매액이 $4,090,000을 초과하면 1달러당 1달러씩 혜택이 단계적으로 축소됩니다. 공제액은 과세 소득을 초과할 수 없지만, 미사용 금액은 이월됩니다.
- 100퍼센트 보너스 감가상각: 2025년 1월 19일 이후 취득한 적격 자산에 대해 영구적으로 복원되었습니다. 섹션 179와 달리 손실을 발생시킬 수 있으며 금액 한도가 없습니다.
- 일반 MACRS: 공제를 5년에 걸쳐 분산합니다.
첫 클러스터를 구매하는 수익성 있는 소기업은 흔히 첫해에 전액 비용 처리합니다. 아직 이익이 나지 않는 스타트업은 상계할 소득이 있는 연도까지 공제를 보존하는 MACRS를 선호할 수 있습니다. 어느 쪽이든 장부 감가상각과 세무 감가상각을 별도로 추적하십시오. 세금 신고서가 한꺼번에 전액을 공제하더라도 재무제표는 자산의 내용연수에 걸친 경제적 실질을 반영해야 합니다.
3. 임대한 GPU는 운영비로 남습니다
위의 내용은 GPU를 시간 단위로 클라우드에서 임대하는 경우에는 적용되지 않습니다. 시간제 임대, 예약 인스턴스, GPU 클라우드 구독은 기간 운영 비용이며, 소유보다는 API 경로에 가깝습니다. 이는 타당한 중간 지대(선불 자본 없음, 여전히 종량제)이지만, 임대 청구서에서 대차대조표 자산이나 감가상각 공제를 기대하지 마십시오. CapEx 대 OpEx 결정과 자체 구축 대 구매 결정은 두 개의 별개 축입니다.
4. 지속적인 클러스터 비용은 매출원가와 운영비로 나뉩니다
가동이 시작되면, 비용이 무엇을 지원하는지에 따라 분류하십시오.
- 매출원가로: 고객 서빙에 따라 확대되는 항목 — 프로덕션 노드의 전력, 서빙 클러스터의 코로케이션과 대역폭, 프로덕션 모니터링과 로깅, 프로덕션 GPU의 감가상각.
- 운영비로: 엔지니어가 실험하는 프로토타입 박스, 스테이징 환경, 일반 R&D 인프라.
같은 구분이 인건비에도 적용됩니다. 프로덕션 추론을 유지하는 데 쓰인 엔지니어링 시간은 전달을 지원하므로 매출원가에 둘 수 있고, 다음 분기의 모델을 평가하는 데 쓰인 시간은 R&D입니다. SaaS 매출총이익률은 일반적으로 70~85퍼센트를 기준으로 하며, 어느 방향으로든 잘못 분류하면 이익률이 비교 불가능해집니다. API와 호스팅 지출을 간접비에 두면 이익률은 인위적으로 훌륭해 보이고 운영비는 부풀려 보입니다.
5. 손익분기를 넘으면 매출총이익률이 확대되어야 합니다
마이그레이션 후 매달 이 등식을 관찰하십시오. 매출원가의 API 항목은 0(또는 하이브리드 구성에서 20퍼센트 프런티어 잔여분)을 향해 줄어들고, 더 작은 감가상각+호스팅 합계로 대체되어야 합니다. 안정적 운영에 들어간 후 한두 분기 안에 매출총이익률이 개선되지 않는다면, 가동률이 모델링한 것보다 낮거나 숨은 운영 비용이 절감액을 잠식한 것입니다. 이는 결정을 방어하기보다 재검토하라는 신호입니다.
평문 원장에서 구매 자체는 하나의 균형 잡힌 분개입니다. 현금에서 장비로의 자산 교환이며, 감가상각 분개가 매달 비용을 인식합니다. 이런 식으로 고정자산을 모델링한 적이 없다면, Beancount 문서가 계정, 감가상각 기장, 보고서를 단계별로 안내합니다.
절감액을 지워버리는 실수들
실패한 자체 호스팅 마이그레이션 대부분은 GPU 벤치마크에서 실패하지 않습니다. 스프레드시트가 빠뜨린 비용에서 실패합니다.
최대치를 기준으로 산정하고 평균을 지불함. 가장 바쁜 시간에 맞춰 프로비저닝된 클러스터는 하루의 나머지 시간에 절반쯤 비어서 돌아갑니다. 모든 유휴 시간은 토큰 없이 발생하는 감가상각입니다. 오토스케일링은 임대 GPU에서는 도움이 되지만, 소유한 하드웨어에서는 충분한 기본 사용량 외에는 해결책이 없습니다.
운영 꼬리 비용을 잊음. 한 상세한 분석은 소규모 4-GPU 구성의 하드웨어 외 숨은 월 비용을 $4,700~$7,900으로 제시합니다. 월 820시간의 엔지니어링 시간(부담 인건비 기준 $2,500$5,000), 전력($400~$600), 네트워킹과 스토리지, 모니터링, 예비 이중화 장비입니다. 이 중 어느 것도 GPU 가격 비교에는 나타나지 않습니다.
가동 시간 격차를 무시함. API 제공업체는 일반적으로 99.9퍼센트 SLA 가동률을 보장합니다. 철저한 이중화 투자 없이 자체 운영하는 클러스터는 현실적으로 95~99퍼센트에 그칩니다. 카드 고장, 메모리 부족 충돌, 새벽 2시에 배포를 망가뜨리는 CUDA 드라이버 업데이트 등입니다. AI가 견인하는 월 $100,000의 매출에서 다운타임 1퍼센트포인트 추가는 대응 비용을 세기 전에 월 $1,000의 비용입니다.
API 지출을 간접비로 계상함. 추론 비용이 매출원가가 아니라 일반 비용에 있다면, 매출총이익률은 양방향으로 허구가 됩니다. 마이그레이션 전에는 과대평가되고, 마이그레이션 후 개선은 보이지 않습니다. 비교하기 전에 분류를 바로잡으십시오.
내용연수 낙관주의. 일부 하이퍼스케일러는 GPU를 56년에 걸쳐 감가상각하지만, 분석가들은 각 세대가 이전 세대를 얼마나 빨리 진부화시키는지를 고려할 때 경제적 수명이 23년에 더 가깝다고 주장합니다. 다음 아키텍처가 출시될 때 클러스터의 잔존 가치가 폭락한다면, 환상의 자산을 계속 보유하기보다 손상을 인식하십시오.
프로토타입 지출과 프로덕션을 혼합함. 파인튜닝을 평가하려고 산 GPU는 R&D입니다. 고객 트래픽을 서빙하는 클러스터는 프로덕션입니다. 이를 한 계정에 섞으면 매출총이익률과 R&D 세액공제 지원 둘 다 훼손됩니다.
구매 전 의사결정 체크리스트
느낌이 아니라 실제 숫자로 다음 여섯 가지 질문을 검토하십시오.
- 사용량: 지속적인 월 API 지출이 대략 $20,000을 넘거나, 두 분기 안에 그 수준에 도달할 것이 확실한가?
- 어떤 API를 대체하는가? 프리미엄 프런티어 가격은 월 10억 토큰 부근에서 손익분기를 맞추고, 저가 API 가격은 결코 손익분기를 맞추지 못할 수 있습니다.
- 트래픽 형태: 부하가 GPU를 계속 바쁘게 유지할 만큼 평탄한가, 아니면 최대치 프로비저닝이 용량을 놀리게 될 것인가?
- 전문성: 팀에 이미 CUDA, 양자화, vLLM 튜닝을 다루는 사람이 있는가, 아니면 회수 계산에 채용 비용을 계상하고 있는가?
- 현금과 세금: 선불 자본을 조달할 수 있고, 섹션 179 또는 보너스 공제를 활용할 소득이 있는가, 아니면 MACRS가 더 유리할 것인가?
- 비재무적 동인: 프라이버시, 규정 준수, 100ms 미만 지연 시간 요구사항이 비용과 무관하게 자체 호스팅을 강제하는가?
약한 답변이 세 개 이상이면 당분간 API(또는 하이브리드 분할)에 머무르십시오. 사용량이 그 선에 도달할 때 그 한계선은 여전히 있을 것이며, 그때쯤이면 다음 GPU 세대가 당신에게 유리한 방향으로 그것을 옮겨 놓았을 것입니다.
추론 지출을 읽을 수 있게 유지하십시오
토큰당 지불하든 감가상각 일정에 따라 지불하든, 추론은 이제 가장 큰 비용 항목 중 하나이며, 손익계산서의 정체불명의 단일 합계보다 더 나은 대우를 받을 자격이 있습니다. API 지출과 호스팅을, 프로덕션 GPU와 프로토타입 박스를, 장부 감가상각과 세무 감가상각을 분리하는 것이 손익분기선을 일회성 계산에서 매달 지켜볼 수 있는 숫자로 바꿔줍니다.
Beancount.io는 재무 데이터에 대한 완전한 투명성과 통제를 제공하는 평문 회계를 제공합니다. 블랙박스도, 벤더 종속도 없습니다. 클러스터를 고정자산으로 추적하고, 일정에 따라 감가상각을 기장하고, 그것이 Fava의 보고서를 통해 흐르는 것을 지켜보십시오. 무료로 시작하고 AI 인프라 지출을 인프라 코드만큼 읽기 쉽게 유지하십시오.





