LOG-009는 산술 연산을 Python 인터프리터에 오프로드하여 모델이 직접 계산할 필요가 없게 하는 PAL을 다루었습니다. 자기 일관성은 직교하는 문제를 공격합니다: 모델이 대부분의 경우 올바르게 추론하지만 항상 그렇지 않다면 어떻게 할까요? 답은 아키텍처적이라기보다 통계적인 것으로 밝혀졌으며 — 놀라울 정도로 효과적입니다.
논문
"Self-Consistency Improves Chain of Thought Reasoning in Language Models" (저자: Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery, Denny Zhou, ICLR 2023, arXiv:2203.11171)은 단일 탐욕적 사고 사슬 경로를 많은 샘플링된 경로에 대한 다수결 투표로 대체하는 디코딩 전략을 소개합니다. 직관은 간결합니다: 어려운 추론 문제는 일반적으로 하나의 정답이 있지만 그 답에 도달하는 여러 유효한 경로가 있습니다; 오답은 모두 동일한 실수로 수렴하지 않는 특이한 오류에서 비롯될 가능성이 더 높습니다.
이 방법은 플러그 앤 플레이 방식입니다. 이미 가지고 있는 사고 사슬(CoT) 프롬프트를 사용하여, 0이 아닌 온도에서 N개의 완성을 샘플링하고, 각각에서 최종 답을 추출한 후, 다수결 답을 반환합니다. 미세 조정, 추가 모델, 추가 인간 라벨이 필요 없습니다.
핵심 아이디어
- 샘플 크기 및 온도: 논문은 온도 0.7에서 문제당 40개의 추론 경로를 사용합니다. 이는 하이퍼파라미터 검색에서 나온 마법의 숫자가 아닙니다 — 절제 연구에 따르면 이득은 약 20–30개 샘플에서 정체되므로 40은 보수적인 선택입니다.
- 표준 CoT 대비 주요 이득: GSM8K +17.9%, SVAMP +11.0%, AQuA +12.2%, StrategyQA +6.4%, ARC-challenge +3.9% — 모두 동일한 모델과 프롬프트로 절대 정확도가 향상되었습니다.
- 모델별 GSM8K 결과: text-davinci-002(GPT-3)에서 자기 일관성은 정확도를 78.7%에서 86.5%로 끌어올립니다. Codex에서는 74.5%에서 82.3%로. 이득은 모델 계열 전반에 걸쳐 일관됩니다.
- 훈련 비용 없음: 모든 것이 추론 시간에 발생합니다. 이 접근 방식은 온도 > 0에서 샘플링할 수 있는 모든 블랙박스 API에서 작동합니다.
- 추출 가능한 답에 대한 다수결 투표: 답이 이산적일 때(숫자, 선택지) 집계는 깔끔합니다. 개방형 생성의 경우 논문은 "가장 일관된" 것을 정의하는 데 덜 구체적입니다 — 저자가 인정한 한계입니다.
무엇이 유효한가 — 그리고 무엇이 그렇지 않은가
경험적 이득은 실제이며, 널리 재현되었고, 이 방법은 진정으로 유용합니다. 그러나 몇 가지 구조적 약점이 주목을 받아야 합니다.
첫째, 비용은 샘플 수에 따라 선형적으로 증가합니다. 추론 시 40개 경로를 샘플링하는 것은 단일 경로의 토큰 예산의 40배가 듭니다. 지연 시간과 API 비용이 중요한 작업 — 밤에 수백 건의 거래를 처리하는 에이전트 — 에서 이는 공짜가 아닙니다. 후속 연구(Early-Stopping Self-Consistency, ICLR 2024)가 이를 해결합니다: 투표가 신뢰도 임계값에 도달하면 중단함으로써 GSM8K에서 측정 가능한 정확도 손실 없이 샘플을 80% 줄일 수 있습니다. 기본 논문은 비용을 전혀 논의하지 않는데, 이는 이상한 누락입니다.
둘째, 모델이 체계적으로 틀릴 때 다수결 투표 가정은 붕괴됩니다. 모델이 통화 변환을 일관되게 잘못 읽거나 40개 경로 모두에서 세금 규칙을 잘못 적용하면, 오답이 투표에서 승리합니다. 자기 일관성은 올바른 오류가 아닌 가장 흔한 오류를 증폭시킵니다. 이것이 핵심 인식론적 격차입니다: 이 방법은 모델의 신념 분포 내부에서 정밀도를 높이지만, 그 분포가 오답에 중심을 둘 때 보정에는 아무것도 하지 않습니다.
셋째, Wang & Wang(2025, arXiv:2503.16974)은 50개의 독립 실행에 걸쳐 금융 및 회계 작업에서 LLM 일관성을 직접 연구합니다. 이진 분류와 감정 분석은 단일 샘플로 이미 거의 완벽하게 재현 가능하다는 것을 발견한 반면, 복잡한 작업(예측, 생성)은 실제 변동성을 보여줍니다. 그들의 실용적 발견: 단지 3–5개의 실행을 집계하면 복잡한 작업에서 일관성을 극적으로 향상시킵니다 — 동일한 자기 일관성 아이디어의 훨씬 저렴한 버전입니다.
이것이 금융 AI에 중요한 이유
Beancount 원장 작업 중 다단계 산술 연산을 포함하는 것 — 세금 계산, 외환 조정 원가 기준, 상각 일정, 송장 매칭 — 은 단일 탐욕적 디코딩이 신뢰할 수 없지만 정답이 고유하고 검증 가능한 바로 그 작업입니다. 자기 일관성은 출력을 확인할 수 있는 모든 금융 에이전트 작업(잔액이 여전히 0인가?)에 대해 표준이 되어야 하는 저렴한 개입입니다.
더 흥미로운 함의는 아키텍처적입니다. 자기 일관성은 추론을 투표 앙상블로 전환합니다. 원장에 분개 항목을 게시하는 에이전트의 기록 안전성(write-back safety)을 위해, 저는 다수결 신뢰도에 게이트를 두겠습니다: 40개 경로 중 35개가 일치할 때만 게시합니다. 불일치는 에이전트가 기록 대신 인간에게 에스컬레이션해야 한다는 신호입니다. 이는 엔지니어링 복잡성이 아닌 추론 예산을 소비하는 구체적이고 구현 가능한 안전 필터입니다.
체계적 편향 실패 모드는 세금 및 규제 규칙에서 특히 중요합니다, 모델이 관할권별 세부 사항을 환각하는 것으로 알려져 있기 때문입니다. 그러한 경우 PAL(LOG-009)이 올바른 해결책입니다: 계산을 완전히 오프로드합니다. 자기 일관성과 PAL은 서로를 보완합니다 — PAL은 산술 정확도를 처리하고, 자기 일관성은 모호성과 추론 신뢰성을 처리합니다.
다음에 읽을 것
- Tree of Thoughts: Deliberate Problem Solving with Large Language Models (Yao et al., 2023, arXiv:2305.10601) — 자기 일관성을 경로에 대한 투표에서 경로에 대한 검색으로 확장하며, 이는 추론 공간이 병렬로 실행되지 않고 분기할 때 중요합니다.
- Escape Sky-high Cost: Early-stopping Self-Consistency for Multi-step Reasoning (Lei et al., ICLR 2024) — 비용 문제에 대한 해결책; GSM8K에서 정확도를 유지하면서 샘플링을 80% 이상 줄입니다.
- Universal Self-Consistency for Large Language Models (Chen et al., arXiv:2311.17311) — LLM 판사를 사용하여 개방형 생성으로 다수결 투표를 확장하고, 원래 논문이 남긴 집계 격차를 해소합니다.





