본문으로 건너뛰기

AI 벤치마킹 for 회계: LLM이 숫자를 정확히 처리하는지 측정하는 방법

게시됨 약 10분Mike ThriftMike Thrift
AI 벤치마킹 for 회계: LLM이 숫자를 정확히 처리하는지 측정하는 방법

당신의 AI 부기 도구가 커피 한 잔을 마시는 동안 200개의 인보이스를 처리했습니다. 빠르고, 지치지 않고, 자신만만합니다 — 그리고 그중 40개는 틀렸을 수도 있습니다. 2026년 9월 설문조사에 따르면 금융 서비스 전문가의 62%가 AI 생성 오류가 이미 고객에게 도달했다고 답했으며, 감사 기능의 93%가 AI를 사용하지만 60%는 공식 전략이 없다고 합니다. 이 두 숫자 사이의 간극에 잘못된 장부, 실패한 감사, 곤란한 고객 대화가 존재합니다.

불편한 진실: 공급업체들은 깨끗하고 엄선된 문서로 측정한 정확도 수치를 인용하지만, 당신의 받은편지함은 전혀 그렇지 않습니다. 구겨진 영수증, 세 가지 통화로 된 품목이 있는 여러 페이지 분량의 인보이스, 인보이스처럼 보이는 대변 메모, 분기마다 레이아웃을 바꾸는 공급업체 — 이것이 실제 테스트 세트입니다. 회계 워크플로우 어디에서든 AI를 사용한다면, 자체 벤치마크가 필요합니다: 모델이 무엇을 정확히 처리하는지, 무엇을 잘못 처리하는지, 개선 중인지 아니면 조용히 성능이 저하되고 있는지를 반복 측정 가능한 방식으로 파악하는 것입니다. 이 가이드가 그 구축 방법을 보여드립니다.

"맞아 보인다"는 측정이 아닌 이유

대규모 언어 모델(LLM)은 인간과 같은 방식으로 실수를 하지 않습니다. 피곤한 부기 담당자가 두 숫자를 바꿔 적으면 오류는 오류처럼 보입니다. LLM은 그럴듯한 인보이스 합계를 완전한 자신감으로 환각(hallucination)해내고, 아름답게 포맷한 후 다음으로 넘어갑니다. 문서 추출에 대해 수년간 모델을 테스트한 한 팀이 말했듯이: 모델은 어쨌든 자신만만한 답을 줍니다 — 추론도, 판단도 없이 숫자를 읽을 뿐이며, 최고의 모델조차 100% 정확도로 처리할 수 없습니다.

이러한 실패 모드는 실제 결과를 초래합니다. 감사인들은 이제 AI 생성 작업 문서를 명시적으로 테스트하고 있으며, AI 출력을 입증·테스트·문서화 없이 의존하는 기업은 재무 통제에서 중요한 약점(material weakness)으로 지적될 것으로 예상해야 합니다. 재무 보고에서 환각된 숫자는 명백히 틀려 보이는 경우가 거의 없습니다 — 조작된 품목 합계는 모델이 생성한 스프레드시트에서도 여전히 합산됩니다. 유일한 방어책은 측정입니다: 당신의 문서에서 도구의 실제 오류율을 지속적으로 모니터링하는 것입니다.

측정할 가치가 있는 좋은 소식도 있습니다. 인간 인보이스 검토자와의 직접 비교 테스트에서 LLM은 인보이스 승인 결정에서 최대 92%의 정확도에 도달하여 숙련된 변호사가 세운 72% 상한선을 넘어섰습니다 — 훨씬 더 빠르고 저렴하게 처리하면서 말입니다. AI는 잘 정의된 추출 작업에서 인간을 실제로 능가할 수 있습니다. 벤치마킹의 목적은 AI가 나쁘다는 것을 증명하는 것이 아니라, 당신의 AI가 어디에서 뛰어난지 정확히 찾아내어 완벽히 처리하는 부분은 자동화하고 그렇지 않은 부분은 감독하기 위함입니다.

벤치마킹할 가치가 있는 세 가지 작업

회계 AI는 많은 일을 하지만, 세 가지 작업이 대부분의 위험과 대부분의 작업량을 차지합니다. 하나의 작업에 뛰어난 모델이 다른 작업에서는 실패할 수 있으므로 각각 별도로 벤치마킹하세요.

1. 인보이스 추출

PDF와 스캔에서 구조화된 필드 — 공급업체 이름, 인보이스 번호, 날짜, 품목, 소계, 세금, 합계, 통화 — 를 추출하는 것입니다. 이것은 가장 많은 작업량을 차지하는 작업이자 가장 많이 벤치마킹된 작업입니다: DocILE과 같은 공개 테스트 세트는 55개 인보이스 필드에서 모델을 평가하며, 최첨단 모델조차 약 26%의 필드에서 실패합니다. 품목, 세금 포함 vs 세금 별도 합계, 그리고 오류가 집중되는 다중 통화 인보이스에 특별히 주의하세요.

2. 비용 분류

각 거래를 올바른 계정이나 카테고리에 할당하는 것입니다 — 식비 vs 접대비, 소모품 vs 설비, 계약자 지급 vs 급여. 이것은 라벨링 작업으로 위장한 판단 작업입니다: "올바른" 답은 당신의 계정과목표와 세무 포지션에 따라 달라지므로, 여기서의 정확도는 항상 보편적인 기준이 아닌 당신의 규칙에 대비해 측정됩니다. 카테고리별 정밀도(precision)와 재현율(recall)을 추적하세요. 전체적으로 98% 정확한 모델도 모든 소프트웨어 구독을 잘못 분류할 수 있기 때문입니다.

3. 재무 데이터 입력 및 전기

소스 문서를 실제 분개로 변환하는 것입니다 — 올바른 계정, 올바른 차변/대변 방향, 올바른 금액, 올바른 기간. 작은 오류가 누적되는 작업입니다: 잘못 분류된 비용은 잘못된 셀 하나이지만, 잘못 전기된 분개는 합계시산표, 재무제표, 세금 신고서로 흘러갑니다. 필드별로가 아닌 문서에서 전기된 분개까지 종단 간(end-to-end)으로 벤치마킹하세요.

먼저 Ground-Truth 세트를 구축하세요

벤치마크는 답안지만큼만 정직합니다. 모델을 테스트하기 전에, 당신의 워크플로우에서 실제 문서 50~100개를 모아 직접 라벨링하세요 — 신중하게 말입니다. 모든 라벨링 실수는 나중에 거짓 실패가 되기 때문입니다.

깨끗한 구성이 아닌 현실적인 구성을 목표로 하세요. 좋은 ground-truth 세트는 약 3분의 2가 일반 문서, 3분의 1이 문제가 되는 문서입니다: 저품질 전화 스캔, 영수증의 손글씨 메모, 여러 페이지 분량의 인보이스, 수십 개 품목이 있는 명세서, 대변 메모, 외국어 인보이스, 가장 지저분한 공급업체의 문서. 한 공개 인보이스 에이전트 평가는 정확히 이 구성 — 깨끗한 문서 35개와 문제 문서 15개 — 을 사용했으며, 흥미로운 실패는 모두 문제 세트에서 나타났습니다.

문서별 "맞음/틀림"이 아닌 필드 수준에서 라벨링하세요. 각 인보이스에 대해 공급업체, 인보이스 번호, 발행일, 납기일, 수량과 단가를 포함한 모든 품목, 소계, 세액, 총합계를 기록하세요. 비용의 경우 현재 계정과목표에 따른 올바른 계정을 기록하세요. 라벨을 간단한 스프레드시트나 JSON 파일에 저장하고, 장부와 함께 버전 관리하여 새 모델이나 프롬프트 변경 시 동일한 테스트를 다시 실행할 수 있게 하세요. 이 버전 관리된 답안지가 지속적인 자산입니다; 모델은 오고 갑니다.

AI가 자신의 테스트 세트에 라벨을 붙이도록 하는 유혹을 물리치세요. 모델 지원 라벨링은 초안으로는 괜찮지만, 모든 라벨은 소스 문서와 대조 확인하는 인간에 의해 검증되어야 합니다. 모델이 스스로 작성한 답안지는 측정이 아니라 거울입니다.

실제로 중요한 지표

공급업체 대시보드는 단일 헤드라인 숫자를 좋아합니다. 회계 작업의 경우, 오류마다 비용이 다르기 때문에 소수의 지표가 필요합니다.

필드 수준 정확도는 헤드라인 지표입니다: 모든 테스트 문서에서 요청한 전체 필드 중 정답지와 정확히 일치하는 비율은 얼마입니까? 엄격하게 하세요 — 회계에서 "근사치"는 인정되지 않습니다. $12,540의 합계는 $12,450이 아니며, 반올림하거나, 형식을 바꾸거나, "친절하게" 날짜를 수정하는 모델은 허가 없이 장부를 수정하는 모델입니다.

완전 일치율은 더 엄격한 형제 지표입니다: 모든 필드가 정확히 맞은 문서의 비율은 얼마입니까? 이 숫자가 당신의 검토 업무량을 예측합니다. 82%와 94%의 필드 정확도 차이는 단순해 보이지만 환산해 보면: 82%에서는 약 5개 중 1개 인보이스에 인간이 필요하고, 94%에서는 17개 중 1개뿐입니다.

필드별 정밀도와 재현율은 오류가 어디에 있는지 알려줍니다. 정밀도는 다음과 같이 묻습니다: 모델이 이 필드를 채웠을 때, 얼마나 자주 정확했습니까? 재현율은: 필드가 문서에 존재했을 때, 모델이 얼마나 자주 찾았습니까? 인보이스 합계의 낮은 정밀도는 허구의 숫자를 의미합니다 — 위험합니다. 품목의 낮은 재현율은 건너뛴 행을 의미합니다 — 이것도 위험하지만 적어도 눈에 보입니다. "95% 정확도"가 날짜는 절대 놓치지 않지만 세금 금액을 정기적으로 지어내는 모델을 숨길 수 있으므로 필드별로 분석하세요.

자동 처리율(Straight-through rate) 은 비즈니스 지표입니다: 어떤 비율의 문서가 인간의 개입 없이 받은편지함에서 전기된 분개로 흘러갔습니까? OCR과 LLM 추출 및 결정론적 검증을 결합한 잘 구축된 생산 파이프라인은 약 77%의 자동 처리율과 99%의 필드 수준 정확도를 보고합니다 — 그리고 equally importantly, 어떤 23%를 인간에게 라우팅할지 알고 있습니다. 라우팅 결정을 측정하지 않는 벤치마크는 시스템의 절반만 측정하는 것입니다.

문서당 비용과 지연 시간이 그림을 완성합니다. 2포인트 더 높은 점수를 받지만 인보이스당 비용이 20배 더 드는 최첨단 모델은 복잡한 문서에는 가치가 있을 수 있고 단순한 문서에는 정당화할 수 없을 수 있습니다 — 하지만 어느 쪽인지 알 수 있는 것은 오직 당신의 벤치마크뿐입니다. 정확도와 함께 문서당 달러와 문서당 초를 추적하세요. 그렇지 않으면 인보이스 처리 비용이 세 배가 되는 동안 학점만 최적화하게 됩니다.

테스트 실행 방법

답안지와 지표가 준비되면 절차는 간단합니다:

  1. 테스트 세트를 고정하세요. 무엇을 테스트하기 전에 50~100개 문서와 라벨을 잠그세요. 모델이 실패하는 것을 본 후에는 테스트 세트에 문서를 추가하지 마세요 — 그렇게 하면 측정이 훈련으로 변합니다.
  2. 블라인드로 실행하세요. 프로덕션에서 사용하는 것과 동일한 프롬프트와 설정으로 모델에 원시 문서만 제공하세요. 힌트, 재시도, 선별 없이 말입니다.
  3. 자동으로 채점하세요. 출력을 눈으로가 아닌 스크립트로 필드별로 라벨과 비교하세요. 자동 채점이 재실행을 저렴하게 만들며, 재실행이 바로 핵심입니다.
  4. 모든 오류를 분류하세요. 실패를 검토하면서 오류 분류 체계를 구축하세요: 환각 필드(허구 값), 품목 위치 바꿈, 다중 공급업체 명세서의 잘못된 공급업체, 세금 포함 vs 별도 혼동, 통화 오류, 날짜 형식 재해석, 페이지 건너뜀. 분류 체계의 패턴이 수정 목록이 됩니다 — 더 나은 프롬프트, 전처리 단계 또는 검증 규칙.
  5. 검증 레이어를 추가하고 재테스트하세요. 가장 성능이 좋은 구성은 LLM과 결정론적 검사를 결합합니다: 품목이 소계에 합산됩니까? 소계에 세금을 더하면 합계가 됩니까? 공급업체가 승인된 목록에 있습니까? 날짜가 열린 기간에 있습니까? 각 레이어가 무엇을 제공하는지 확인하려면 이러한 안전장치가 있는 경우와 없는 경우의 정확도를 측정하세요.
  6. 정기적으로 재실행하세요. 모델은 예고 없이 변합니다 — 공급업체는 가중치를 업데이트하고, 버전을 중단하고, 동작을 변경합니다. 월간으로, 그리고 모델, 프롬프트 또는 전처리를 변경할 때마다 벤치마크를 재실행하세요. 한 번 실행한 벤치마크는 기념품이고, 재실행하는 벤치마크는 통제 수단입니다.

벤치마크를 거짓으로 만드는 실수들

대부분의 자체 평가는 예측 가능한 방식으로 실패합니다. 다음 다섯 가지를 피하세요:

깨끗한 인보이스 5개로 테스트하기. 작고 정돈된 테스트 세트는 모델이 정돈된 문서를 읽을 수 있다는 것을 증명합니다 — 이미 알고 있던 사실입니다. 테스트 세트에 스캔, 손글씨, 엣지 케이스가 없다면, 100% 점수는 모델이 아니라 테스트 세트를 측정하는 것입니다.

모델이 스스로 채점하게 하기. LLM-as-judge 채점은 편리하고 체계적으로 관대하며, 특히 테스트 중인 모델의 자체 출력에 대해 그렇습니다. 자동 심사를 사용한다면 매 실행마다 샘플을 손으로 대조 확인하고, 테스트 중인 모델과 다른 모델을 심사자로 사용하세요.

헤더만 채점하고 품목은 무시하기. 헤더 필드(공급업체, 날짜, 합계)는 쉬운 부분입니다. 돈은 품목에 숨어 있습니다 — 잘못된 수량, 누락된 행, 잘못 읽은 단가. 품목을 건너뛰는 벤치마크는 봉투를 감사하고 편지는 무시하는 것입니다.

OCR 정확도와 추출 정확도를 혼동하기. 모든 단어를 정확히 읽는 것과 올바른 숫자를 올바른 필드에 넣는 것은 다른 기술입니다. 전통적인 OCR은 아무것도 이해하지 못하면서 페이지를 완벽하게 필사할 수 있고, LLM은 번진 숫자를 잘못 읽으면서 레이아웃을 이해할 수 있습니다. 필사본이 아닌 구조화된 출력을 채점하세요.

신뢰도 임계값이 없기. 모든 문서가 자동화에 적합한 것은 아닙니다. 전문적인 패턴은 선택적 예측입니다: 시스템은 높은 신뢰도의 추출을 자동으로 전기하고 낮은 신뢰도는 인간에게 라우팅합니다. 벤치마크는 임계값 — 인간 검토가 비용보다 더 많은 오류를 잡는 신뢰도 점수 이하 — 을 찾아야 합니다. 이 단계를 건너뛰는 것은 모든 것을 검토하거나(절감 없음) 모든 것을 신뢰하거나(62% 클럽) 선택하는 것입니다.

"충분히 좋은" 것이 무엇인지

벤치마크는 점수로 무엇을 해야 할지 알 때만 도움이 됩니다. 단계별로 생각하세요:

  • 필드 정확도 85% 미만: 보조 모드만. 모델이 초안을 작성하고 인간이 모든 필드를 검증합니다. 수동 입력보다는 여전히 빠르지만, 아무것도 신뢰하지 마세요.
  • 85–95%: 감독 자동화. 기존 공급업체의 일상적인 문서를 자동 전기하고, 나머지 — 신규 공급업체, 대량 금액, 낮은 신뢰도 추출 — 는 검토로 라우팅하세요. 대부분의 소규모 비즈니스가 운영해야 하는 수준입니다.
  • 검증 안전장치와 함께 95% 이상: 표준 문서의 자동 처리, 드리프트를 잡기 위한 샘플링 감사(월간 무작위 5–10% 재확인) 포함. 여기서도 엄격한 규칙을 유지하세요: 달러 임계값 이상 자동 전기 금지, 마감된 기간으로의 자동 전기 금지, 승인 없는 신규 공급업체 금지.

컨텍스트가 엄청나게 중요합니다. 92% AI 정확도의 인보이스 승인 결정이 72%의 인간 검토자를 이길 수 있습니다 — 하지만 승인은 인간 백스톱이 있는 판단 호출인 반면, 잘못된 합계를 원장에 전기하는 것은 조용한 부패입니다. 자율성을 되돌릴 수 있는 가능성에 맞추세요: 오류를 되돌리기 어려울수록 기준이 높아야 합니다.

깨끗한 장부가 측정을 가능하게 합니다

여기 공급업체가 건너뛰는 부분이 있습니다: 일관된 계정과목표 없이는 비용 분류를 벤치마킹할 수 없고, 대조된 장부 없이는 데이터 입력 정확도를 채점할 수 없습니다. 벤치마크가 필요로 하는 ground-truth 세트는 본질적으로 잘 관리된 장부의 한 조각입니다 — 일관되게 분류되고, 완전히 대조되며, 버전 관리되는 장부 말입니다. 훈련된 부기 관행을 가진 기업은 오후에 벤치마크를 구축할 수 있지만, 스프레드시트에 분류되지 않은 거래가 3개월 치 있는 기업은 답안지가 없기 때문에 아예 구축할 수 없습니다.

이것은 양방향으로 작동합니다. 재무를 감사 가능하게 만드는 것과 동일한 일반 텍스트 원장은 AI를 측정 가능하게 만듭니다: 모든 계정이 텍스트로 정의되고, 모든 분개가 diff에서 검토 가능하며, 모든 수정이 추적 가능합니다. 모델이 분류를 제안하면 어떤 규칙을 따랐는지 또는 어겼는지 정확히 볼 수 있습니다. 그리고 원장을 차트로 렌더링하는 시각화 도구는 모델의 실수 — 그리고 당신 자신의 실수 — 를 한눈에 보이게 합니다; Beancount와 함께 제공되는 Fava 대시보드는 원장 항목을 매월 검토할 수 있는 잔액 및 비용 보기로 변환합니다. AI가 장부를 건드리게 할 것이라면, 실제로 검사할 수 있는 형식으로 장부를 유지하세요.

신뢰하기 전에 측정하세요

회계에서 AI 도입은 더 이상 질문이 아닙니다 — 회계 전문가의 거의 10명 중 9명이 고객 업무에 사용하고 세무 조사에서 사용량이 매년 두 배로 증가함에 따라, 문제는 AI가 당신을 위해 무엇을 하는지 측정하고 있는지 여부입니다. 주말을 투자해 50개 문서 벤치마크를 구축하면 어떤 공급업체 데모도 제공할 수 없는 것을 얻습니다: 당신의 문서와 규칙에서 도구의 실제 오류율에 대한 지식 — 그리고 드리프트가 고객이나 세금 신고서에 도달하기 전에 잡아내는 재실행 가능한 통제 수단입니다.

작게 시작하세요: 인보이스 50개를 모으고, 직접 라벨링하고, 현재 도구를 채점하고, 무엇을 잘못하는지 분류하세요. 숫자가 무엇이든, 그것을 아는 것만으로도 전략 없이 AI를 운영하는 감사 기능의 60%보다 앞서는 것입니다. 회계 AI로 성공하는 기업은 가장 많이 신뢰한 기업이 아니라 가장 먼저 측정한 기업일 것입니다.

AI 검증된 장부를 일반 텍스트로 유지하세요

인보이스 및 비용 추적을 위한 AI 도구를 벤치마킹하고 채택하면서, 검사할 수 있는 명확한 재무 기록을 유지하는 것은 여전히 필수적입니다 — 읽을 수 없는 답안지는 답안지가 아니기 때문입니다. Beancount.io는 재무 데이터에 대한 완전한 투명성과 통제를 제공하는 일반 텍스트 회계를 제공합니다 — 블랙박스도, 공급업체 종속도 없습니다. 무료로 시작하세요 개발자와 금융 전문가가 일반 텍스트 회계로 전환하는 이유를 확인해 보세요.

이 글 공유하기

출처: https://beancount.io/ko/blog/2026/09/15/ai-benchmarking-accounting-llm-accuracy-invoice-expense-guide

게시됨: 2026년 9월 15일

약 12분

QuickBooks Bill Pay, 이제 공급업체 이메일을 읽습니다: AI 청구서 수집이 2026년 수동 데이터 입력에 의미하는 것

수동 송장 입력은 건당 약 12.88달러의 비용이 들고 수령부터 지급까지 17일이 걸리는 반면, 최고 수준의 자동화된 AP 팀은 동일한 송장을…

quickbooks
accounts-payable
약 8분

소상공인을 위한 AI 매입채무 자동화: 비용, 절감 효과, 선택 방법

인보이스를 수작업으로 처리하면 건당 $13~$30가 들고, 인보이스 10건 중 약 4건에 오류가 있으며, 절반 이상이 기한을 넘겨 지급됩니다.…

accounts-payable
automation
약 11분

2026년 외상매입금 자동화: AI 송장 캡처, 3-way 매칭, 터치리스 승인을 통한 처리 비용 절감 및 중복 결제 방지

2026년의 외상매입금(AP) 자동화는 AI 송장 캡처, 3-way 매칭, 규칙 기반의 터치리스 승인을 결합하여 송장 처리 비용을 약…

accounts-payable
automation
약 10분

Ramp의 회계 에이전트와 실시간 결산: 자동 코딩된 장부가 중소기업에 의미하는 것

Ramp의 회계 에이전트는 거래가 발생하는 즉시 모든 거래를 코딩하고, 백그라운드에서 전체 지출의 100%를 검토하며, 일상적인 거래를…

ai
automation
약 5분

인간 오류를 넘어: 평문 회계에서 AI 이상 탐지

AI 기반 이상 탐지가 오류 탐지를 강화하고 투명성을 유지함으로써 평문 회계를 어떻게 혁신하는지, 그리고 재무 시스템의 중요한 취약점을…

ai
fraud-detection