
DIN-SQL: GPT-4, Spider에서 67.4%→85.3% EX로 점프
DIN-SQL이 스키마 링크 및 자체 수정 단계를 통해 GPT-4의 Spider 실행 정확도를 67.4%에서 85.3%로 끌어올립니다—동일한 분해 방식이 Beancount BQL에도 적용됩니다.

DIN-SQL이 스키마 링크 및 자체 수정 단계를 통해 GPT-4의 Spider 실행 정확도를 67.4%에서 85.3%로 끌어올립니다—동일한 분해 방식이 Beancount BQL에도 적용됩니다.

BIRD에서 GPT-4는 도메인 힌트가 있으면 54.89%의 실행 정확도, 없으면 34.88%를 기록합니다—모든 Beancount NL→BQL 인터페이스가 극복해야 할 20포인트 격차입니다.

CMU 및 NC State 연구진은 시스템 이론적 공정 분석(STPA)과 기능이 강화된 모델 컨텍스트 프로토콜을 사용하여 LLM 에이전트 도구 사용에 대한 형식적 안전 사양을 도출할 것을 제안하며, 캘린더 일정 관리 사례 연구를 통해 안전하지 않은 흐름이 없음을 입증하는 Alloy 기반 검증을 선보입니다.

마이크로소프트의 GraphRAG가 벡터 RAG 대비 72–83%의 의미 파악 승리를 기록했으나, 2025년 감사에서 판사 편향을 수정한 후 그 수치가 사라졌습니다—다중 문서 원장 QA에 대한 경고.

FinAuditing은 1,102개의 실제 SEC XBRL 공시 사례를 대상으로 13개의 LLM을 제로샷(zero-shot)으로 테스트했습니다. 최고 점수는 재무 수학 검증에서 13.86%, 개념 검색에서 12.42%로 나타났으며, 이는 외부 도구 없이 AI 회계 도구가 자동화할 수 있는 신뢰 범위의 한계를 직접적으로 보여줍니다.

InvestorBench: Qwen2.5-72B가 46.15%의 CR로 주식 거래를 선도; 금융 특화 Palmyra-Fin은 주식에서 역효과—크기가 도메인 파인튜닝을 이긴다.

StructRAG (ICLR 2025)는 추론 전 각 쿼리를 태스크에 적합한 구조 유형(표, 그래프, 카탈로그, 알고리즘 또는 청크)으로 라우팅합니다. 이를 통해 Loong 벤치마크에서 GraphRAG보다 28점 높은 점수를 기록하고 22배 빠른 속도로 실행되며, DPO로 학습된 라우터만으로도 15점의 정확도 향상을 실현했습니다.

동일한 추론 토큰 예산에서 싱글 에이전트 LLM은 멀티 홉 추론에서 멀티 에이전트 시스템과 동등하거나 더 나은 성능을 보입니다—더 간단한 금융 에이전트 설계를 선호합니다.

M3MAD-Bench는 9개 모델, 5개 도메인, 시각-언어 설정을 아우르며 멀티 에이전트 토론을 스트레스 테스트합니다. 연구 결과 실패 사례의 65%가 '집단적 망상'으로 인해 발생하며, 적대적 토론은 정확도를 최대 12.8%까지 떨어뜨리고, 자기 일관성(Self-Consistency)은 일반적으로 더 적은 토큰 비용으로 토론과 대등한 정확도를 제공한다는 점을 발견했습니다.

AGrail (ACL 2025)은 테스트 시간 적응(TTA)을 통해 추론 시 안전 점검을 조정하는 두 개의 LLM 협력 가드레일을 도입하여, Safe-OS에서 프롬프트 인젝션 공격 성공률 0%와 정상 작업 보존율 95.6%를 달성했습니다. 이는 GuardAgent 및 LLaMA-Guard가 정상 작업의 최대 49.2%를 차단하는 것과 대조적입니다.

ShieldAgent (ICML 2025)는 LLM 기반 가드레일을 마르코프 논리 네트워크 기반의 확률적 규칙 회로로 대체하여, 64.7% 적은 API 호출로 에이전트 공격에 대해 90.4%의 정확도를 달성했습니다. 이것이 금융 AI 시스템의 검증 가능한 안전성에 어떤 의미를 갖는지 살펴봅니다.

Atlas (JMLR 2023)는 단 64개의 학습 예시만으로 Natural Questions에서 42.4%의 정확도를 달성하며, 110억 개의 파라미터로 5,400억 개의 PaLM을 3포인트 차이로 앞섰습니다. 이는 Contriever 기반 밀집 검색기와 T5 Fusion-in-Decoder 리더를 합동 사전 학습함으로써 가능했습니다. 본 분석은 검색 정확도의 한계, 587GB 인덱스 인프라 비용, 그리고 Beancount 장부 질의응답(QA) 시스템에 미치는 영향을 다룹니다.