
Fusion-in-Decoder: 다중 구절 검색이 생성형 QA를 개선하는 방법
Izacard와 Grave의 FiD 아키텍처는 검색된 구절을 독립적으로 인코딩한 후 디코더에서 융합하여, NQ 및 TriviaQA에서 RAG-Sequence보다 4~11점 높은 성능을 보입니다. 이 게시물은 해당 설계와 여러 거래 간의 다중 항목 합성이 일반적인 Beancount 원장 QA에 대한 시사점을 살펴봅니다.

Izacard와 Grave의 FiD 아키텍처는 검색된 구절을 독립적으로 인코딩한 후 디코더에서 융합하여, NQ 및 TriviaQA에서 RAG-Sequence보다 4~11점 높은 성능을 보입니다. 이 게시물은 해당 설계와 여러 거래 간의 다중 항목 합성이 일반적인 Beancount 원장 QA에 대한 시사점을 살펴봅니다.

GuardAgent(ICML 2025)는 대상 에이전트와 환경 사이에 별도의 LLM 에이전트를 배치하여, Python 코드를 생성하고 실행함으로써 제안된 모든 동작을 검증합니다. 이를 통해 프롬프트 내장형 안전 규칙이 81%의 정확도와 29~71%의 작업 실패율을 보이는 것과 대조적으로, 100%의 작업 완료율을 유지하면서 98.7%의 정책 준수 정확도를 달성합니다.

산술 능력에서 14.8점의 정확도 향상을 보고한 Du 등의 ICML 2024 다중 에이전트 토론 논문을 분석하고, 동일한 예산의 단일 에이전트 성능과 비교한 2025년 반박 연구, 그리고 토론 실패의 65%를 차지하는 '집단적 망상'이 AI 기반 장부 기입에 미치는 위험성을 살펴봅니다.

NeurIPS 2024 Spotlight 논문은 OneFitsAll, Time-LLM, CALF 등 세 가지 LLM 기반 시계열 예측 방법을 분석한 결과, 언어 모델을 제거했을 때 대부분의 경우 정확도가 향상되고 학습 속도가 최대 1,383배 빨라진다는 사실을 발견했습니다. Beancount 잔액 예측과 같은 금융 AI 애플리케이션의 경우, 가벼운 전용 모델이 기존 LLM을 재활용한 모델보다 일관되게 우수한 성능을 보입니다.

AuditCopilot은 오픈 소스 LLM(Mistral-8B, Gemma, Llama-3.1)을 기업 분개 부정 탐지에 적용하여 오탐(false positive)을 942건에서 12건으로 줄였습니다. 하지만 소거 연구 결과, LLM은 독립적인 이상 탐지기가 아니라 주로 Isolation Forest 점수 위에 구축된 종합 레이어로 기능한다는 점이 밝혀졌습니다.

TAT-LLM은 FinQA에서 64.60%의 EM을 달성하여 GPT-4의 63.91%를 능가했으며, 추론을 결정론적인 추출-추론-실행 단계로 분해하여 산술 오류를 제거함으로써 재무 표-텍스트 QA 벤치마크에서 LoRA로 LLaMA 2 7B를 미세 조정했습니다.

7B 파라미터 LLM을 대상으로 RAG와 비지도 파인튜닝을 실증 비교한 결과, RAG는 학습 중단 시점 이후의 사실에 대해 0.875 이상의 정확도를 달성한 반면 파인튜닝은 0.504에서 정체되었습니다. 이는 Beancount 에이전트 설계 및 빈번한 지식 업데이트가 필요한 시스템에 직접적인 시사점을 제공합니다.

IRCoT는 BM25 검색을 사고의 사슬 추론 루프의 각 단계와 교차시켜, 단일 단계 RAG 대비 HotpotQA에서 검색 재현율 +11.3, F1 점수 +7.1을 달성했습니다. 또한 검색 전략이 적절할 경우 3B 모델이 GPT-3 175B를 능가할 수 있음을 보여줍니다.

FLARE(EMNLP 2023)는 토큰 확률 신뢰도 임계값을 기반으로 생성 도중에 검색을 트리거하여 표준 RAG를 개선합니다. 2WikiMultihopQA에서 단일 검색의 39.4 EM 대비 51.0 EM을 달성했지만, 지시어 튜닝된 채팅 모델에서의 캘리브레이션 실패로 인해 실제 프로덕션 환경의 금융 에이전트에서의 신뢰성은 제한적입니다.

Lewis 외 연구진이 고정 FAISS 인덱스로 Natural Questions에서 44.5 EM을 달성했습니다. Beancount 원장의 경우 잔액이 매일 변할 때 인덱스를 다시 구축하거나 데이터를 놓치게 됩니다.

MultiHiertt (ACL 2022)는 실제 재무 보고서에서 추출한 10,440개의 QA 쌍을 소개하며, 각 보고서는 평균 3.89개의 계층적 테이블을 포함합니다. 최신 모델의 F1 점수는 38%인 반면 인간은 87%를 기록했으며, 교차 테이블 질문에서는 15점의 점수 하락이 발생했습니다. 이는 금융 AI가 해결해야 할 정보 검색 격차를 수치화한 것입니다.

ConvFinQA의 최고 모델은 실행 정확도 68.9%로 인간 전문가의 89.4%에 비해 21포인트 격차를 보이며, 다중 턴 원장 채팅이 여전히 해결해야 할 과제입니다.