Bean Labs
자율 금융 지능의 경계를 탐구합니다.
Beancount.io의 연구 이니셔티브
Bean Labs는 자율적인 부기(bookkeeping)에 관한 공개 연구 노트를 발행합니다 — 복식부기 원장을 추론하고, 검증 가능한 감사 추적을 생성하며, 일반 텍스트 회계에 기반을 두는 언어 모델에 관한 것입니다.
최근 연구 노트
Bean Labs의 공개 실험과 연구 결과 — Beancount.io의 Finance AI Agent 연구 이니셔티브.
주제별 연구
우리가 가장 자주 다루는 주제별로 연구 로그를 둘러보세요.
LLM
Large language model research with applications in financial tasks
- 당신의 에이전트가 이 장부를 맞출 수 있나요?
- FinRAGBench-V: 금융 도메인의 시각적 인용을 포함한 멀티모달 RAG
- LLM 에이전트가 CFO가 될 수 있을까? EnterpriseArena의 132개월 시뮬레이션이 보여주는 거대한 격차
- WildToolBench: 실제 환경의 도구 사용에서 LLM의 세션 정확도가 15%를 넘지 못하는 이유
- LLM의 신뢰도와 캘리브레이션: 연구 결과가 실제로 보여주는 것에 대한 서베이
- JSONSchemaBench: 실제 스키마 복잡성으로 인한 LLM 구조적 출력 보장 실패
- FinMCP-Bench: MCP 기반 실제 금융 도구 사용을 위한 LLM 에이전트 벤치마킹
- FinTrace: 금융 작업을 위한 LLM 도구 호출의 궤적 수준 평가
- FinToolBench: 실제 금융 도구 사용에 대한 LLM 에이전트 평가
- OmniEval: 금융 도메인을 위한 전방위적 RAG 평가 벤치마크
- LLM 이상 탐지 서베이 (NAACL 2025): 강력한 분류 체계, 부족한 정형 데이터 커버리지
- 중간에서 찾기: 위치적 어텐션 편향 보정을 통한 롱 컨텍스트 RAG 개선
AI
Artificial intelligence research and applications in finance and accounting
- FinRAGBench-V: 금융 도메인의 시각적 인용을 포함한 멀티모달 RAG
- LLM 에이전트가 CFO가 될 수 있을까? EnterpriseArena의 132개월 시뮬레이션이 보여주는 거대한 격차
- WildToolBench: 실제 환경의 도구 사용에서 LLM의 세션 정확도가 15%를 넘지 못하는 이유
- LLM의 신뢰도와 캘리브레이션: 연구 결과가 실제로 보여주는 것에 대한 서베이
- JSONSchemaBench: 실제 스키마 복잡성으로 인한 LLM 구조적 출력 보장 실패
- FinMCP-Bench: MCP 기반 실제 금융 도구 사용을 위한 LLM 에이전트 벤치마킹
- FinTrace: 금융 작업을 위한 LLM 도구 호출의 궤적 수준 평가
- FinToolBench: 실제 금융 도구 사용에 대한 LLM 에이전트 평가
- OmniEval: 금융 도메인을 위한 전방위적 RAG 평가 벤치마크
- LLM 이상 탐지 서베이 (NAACL 2025): 강력한 분류 체계, 부족한 정형 데이터 커버리지
- 중간에서 찾기: 위치적 어텐션 편향 보정을 통한 롱 컨텍스트 RAG 개선
- LLM 에이전트를 위한 불확실성 기반 위임: 소형 모델에서 대형 모델로 전환하는 시점
Machine Learning
Machine learning techniques for financial data analysis and automation
- FinRAGBench-V: 금융 도메인의 시각적 인용을 포함한 멀티모달 RAG
- WildToolBench: 실제 환경의 도구 사용에서 LLM의 세션 정확도가 15%를 넘지 못하는 이유
- LLM의 신뢰도와 캘리브레이션: 연구 결과가 실제로 보여주는 것에 대한 서베이
- JSONSchemaBench: 실제 스키마 복잡성으로 인한 LLM 구조적 출력 보장 실패
- FinMCP-Bench: MCP 기반 실제 금융 도구 사용을 위한 LLM 에이전트 벤치마킹
- FinTrace: 금융 작업을 위한 LLM 도구 호출의 궤적 수준 평가
- FinToolBench: 실제 금융 도구 사용에 대한 LLM 에이전트 평가
- OmniEval: 금융 도메인을 위한 전방위적 RAG 평가 벤치마크
- LLM 이상 탐지 서베이 (NAACL 2025): 강력한 분류 체계, 부족한 정형 데이터 커버리지
- 중간에서 찾기: 위치적 어텐션 편향 보정을 통한 롱 컨텍스트 RAG 개선
- LLM 에이전트를 위한 불확실성 기반 위임: 소형 모델에서 대형 모델로 전환하는 시점
- OpenHands: AI 소프트웨어 에이전트를 위한 개방형 플랫폼과 금융 자동화에 시사하는 점
Beancount
Beancount ledger format, tooling, and ecosystem research
- 당신의 에이전트가 이 장부를 맞출 수 있나요?
- FinRAGBench-V: 금융 도메인의 시각적 인용을 포함한 멀티모달 RAG
- LLM 에이전트가 CFO가 될 수 있을까? EnterpriseArena의 132개월 시뮬레이션이 보여주는 거대한 격차
- WildToolBench: 실제 환경의 도구 사용에서 LLM의 세션 정확도가 15%를 넘지 못하는 이유
- JSONSchemaBench: 실제 스키마 복잡성으로 인한 LLM 구조적 출력 보장 실패
- FinMCP-Bench: MCP 기반 실제 금융 도구 사용을 위한 LLM 에이전트 벤치마킹
- FinTrace: 금융 작업을 위한 LLM 도구 호출의 궤적 수준 평가
- FinToolBench: 실제 금융 도구 사용에 대한 LLM 에이전트 평가
- OmniEval: 금융 도메인을 위한 전방위적 RAG 평가 벤치마크
- LLM 이상 탐지 서베이 (NAACL 2025): 강력한 분류 체계, 부족한 정형 데이터 커버리지
- 중간에서 찾기: 위치적 어텐션 편향 보정을 통한 롱 컨텍스트 RAG 개선
- LLM 에이전트를 위한 불확실성 기반 위임: 소형 모델에서 대형 모델로 전환하는 시점
Automation
Automation techniques and tools for financial data processing workflows
- LLM 에이전트가 CFO가 될 수 있을까? EnterpriseArena의 132개월 시뮬레이션이 보여주는 거대한 격차
- WildToolBench: 실제 환경의 도구 사용에서 LLM의 세션 정확도가 15%를 넘지 못하는 이유
- JSONSchemaBench: 실제 스키마 복잡성으로 인한 LLM 구조적 출력 보장 실패
- FinMCP-Bench: MCP 기반 실제 금융 도구 사용을 위한 LLM 에이전트 벤치마킹
- FinTrace: 금융 작업을 위한 LLM 도구 호출의 궤적 수준 평가
- FinToolBench: 실제 금융 도구 사용에 대한 LLM 에이전트 평가
- OmniEval: 금융 도메인을 위한 전방위적 RAG 평가 벤치마크
- 중간에서 찾기: 위치적 어텐션 편향 보정을 통한 롱 컨텍스트 RAG 개선
- LLM 에이전트를 위한 불확실성 기반 위임: 소형 모델에서 대형 모델로 전환하는 시점
- OpenHands: AI 소프트웨어 에이전트를 위한 개방형 플랫폼과 금융 자동화에 시사하는 점
- TableMaster: LLM을 활용한 표 이해를 위한 적응형 추론
- LLM을 활용한 제로샷 이상 탐지: GPT-4의 정형 데이터 성능 분석
Data Science
Data science methods applied to financial datasets and accounting workflows
- FinRAGBench-V: 금융 도메인의 시각적 인용을 포함한 멀티모달 RAG
- WildToolBench: 실제 환경의 도구 사용에서 LLM의 세션 정확도가 15%를 넘지 못하는 이유
- LLM의 신뢰도와 캘리브레이션: 연구 결과가 실제로 보여주는 것에 대한 서베이
- FinToolBench: 실제 금융 도구 사용에 대한 LLM 에이전트 평가
- OmniEval: 금융 도메인을 위한 전방위적 RAG 평가 벤치마크
- LLM 이상 탐지 서베이 (NAACL 2025): 강력한 분류 체계, 부족한 정형 데이터 커버리지
- 중간에서 찾기: 위치적 어텐션 편향 보정을 통한 롱 컨텍스트 RAG 개선
- Fin-RATE: LLM이 기간 간 및 기업 간 재무 분석에서 실패하는 방식
- FinDER: 실제 분석가 쿼리를 통해 드러난 금융 RAG의 74% 재현율 격차
- Lost in the Middle: LLM의 위치 편향과 금융 AI에 미치는 영향
- AD-LLM 벤치마크: GPT-4o, 텍스트 이상 탐지에서 제로샷 AUROC 0.93+ 달성
- CausalTAD: LLM 정형 데이터 이상 탐지를 위한 인과적 열 순서 지정
Finance
Financial research, analysis, and domain knowledge for accounting AI
- FinRAGBench-V: 금융 도메인의 시각적 인용을 포함한 멀티모달 RAG
- LLM의 신뢰도와 캘리브레이션: 연구 결과가 실제로 보여주는 것에 대한 서베이
- FinTrace: 금융 작업을 위한 LLM 도구 호출의 궤적 수준 평가
- OmniEval: 금융 도메인을 위한 전방위적 RAG 평가 벤치마크
- FinDER: 실제 분석가 쿼리를 통해 드러난 금융 RAG의 74% 재현율 격차
- Lost in the Middle: LLM의 위치 편향과 금융 AI에 미치는 영향
- AnoLLM: 금융 데이터의 정형 변칙 탐지를 위한 LLM 미세 조정
- DocFinQA: 전체 SEC 공시 자료를 활용한 롱 컨텍스트 금융 추론
- TheAgentCompany: 실제 기업 업무에서의 LLM 에이전트 벤치마킹
- InvestorBench: Qwen2.5-72B, 46.15%의 CR로 주식 1위
- 싱글 에이전트: 동일 토큰 예산에서 멀티 홉 추론 시 멀티 에이전트와 동등한 성능
- M3MAD-Bench: 멀티 에이전트 토론은 도메인과 모달리티 전반에서 정말로 효과적인가?
Plain-Text Accounting
Research grounded in plain-text accounting formats and workflows
- 당신의 에이전트가 이 장부를 맞출 수 있나요?
- LLM 에이전트를 위한 불확실성 기반 위임: 소형 모델에서 대형 모델로 전환하는 시점
- OpenHands: AI 소프트웨어 에이전트를 위한 개방형 플랫폼과 금융 자동화에 시사하는 점
- Beancount DSL 생성에서 LLM 점수 2.3%: LLMFinLiteracy 벤치마크
- TableMaster: LLM을 활용한 표 이해를 위한 적응형 추론
- τ²-bench: 대화형 AI 에이전트의 이중 제어 비용 측정
- GAIA 벤치마크: 프런티어 AI 에이전트의 실제 수행 능력 측정
- WorkArena: LLM 웹 에이전트가 실제 기업 지식 업무에서 보여주는 성능
- τ-bench: 실제 도구 사용 도메인에서의 AI 에이전트 신뢰도 측정
- Chain-of-Table: LLM 추론 체인에서의 테이블 진화
- TableLlama: Can a 7B Open Model Match GPT-4 on Table Understanding?
- TAPAS: SQL 없는 약지도 학습 기반 테이블 질의응답과 Beancount에 주는 의미
연구에 접근하는 방식
평문 우선
일반 텍스트 원장에서 출발해 입력 데이터를 읽기 쉽고, 이식 가능하며, 검토할 수 있는 형태로 유지합니다.
기본적으로 재현 가능
입력, 방법, 한계를 명확히 밝혀 다른 사람들이 작업을 검토하고 발전시킬 수 있게 합니다.
열린 발견
연구 노트를 공개하고 커뮤니티가 결과를 비판적으로 살펴보고 확장하며 개선하도록 초대합니다.
연구 소식 받아보기
공개된 노트를 읽고 연구 기록에서 다음 질문을 함께 살펴보세요.