Bean Labs
自律的金融知能の限界を研究する。
Beancount.io による研究イニシアチブ
Bean Labs は自律的な簿記に関するオープンな研究ノートを公開しています。複式簿記の台帳に対して推論し、検証可能な監査証跡を生成し、プレーンテキスト会計に根ざした言語モデルについての研究です。
最近の研究ノート
Bean Labs からのオープンな実験と発見 — Beancount.io による Finance AI Agent 研究イニシアチブ。
トピック別リサーチ
私たちが最も頻繁に取り組むテーマごとに研究ログを閲覧できます。
LLM
Large language model research with applications in financial tasks
- あなたのエージェントはこれらの帳簿を一致させられますか?
- FinRAGBench-V:金融領域における視覚的引用を伴うマルチモーダルRAG
- LLMエージェントはCFOになれるのか?EnterpriseArenaによる132ヶ月のシミュレーションで明らかになった大きな格差
- WildToolBench: なぜ現実世界のツール利用においてLLMのセッション精度は15%を超えないのか
- LLMの信頼度とキャリブレーション:研究が実際に示していることの調査
- JSONSchemaBench: 現実世界のスキーマの複雑さがLLMの構造化出力の保証を破壊する
- FinMCP-Bench: MCP下での実世界の金融ツール利用に向けたLLMエージェントのベンチマーク
- FinTrace:金融タスクにおけるLLMツール呼び出しのトラジェクトリレベル評価
- FinToolBench:実世界の金融ツール使用におけるLLMエージェントの評価
- OmniEval: 金融分野向け全方位型RAG評価ベンチマーク
- LLM異常検知サーベイ (NAACL 2025):強力な分類体系、欠如した表形式データへの対応
- Found in the Middle: 位置的アテンションバイアスの校正によるロングコンテキストRAGの改善
AI
Artificial intelligence research and applications in finance and accounting
- FinRAGBench-V:金融領域における視覚的引用を伴うマルチモーダルRAG
- LLMエージェントはCFOになれるのか?EnterpriseArenaによる132ヶ月のシミュレーションで明らかになった大きな格差
- WildToolBench: なぜ現実世界のツール利用においてLLMのセッション精度は15%を超えないのか
- LLMの信頼度とキャリブレーション:研究が実際に示していることの調査
- JSONSchemaBench: 現実世界のスキーマの複雑さがLLMの構造化出力の保証を破壊する
- FinMCP-Bench: MCP下での実世界の金融ツール利用に向けたLLMエージェントのベンチマーク
- FinTrace:金融タスクにおけるLLMツール呼び出しのトラジェクトリレベル評価
- FinToolBench:実世界の金融ツール使用におけるLLMエージェントの評価
- OmniEval: 金融分野向け全方位型RAG評価ベンチマーク
- LLM異常検知サーベイ (NAACL 2025):強力な分類体系、欠如した表形式データへの対応
- Found in the Middle: 位置的アテンションバイアスの校正によるロングコンテキストRAGの改善
- LLMエージェントにおける不確実性を考慮したディフェラル:小規模モデルから大規模モデルへいつエスカレーションすべきか
Machine Learning
Machine learning techniques for financial data analysis and automation
- FinRAGBench-V:金融領域における視覚的引用を伴うマルチモーダルRAG
- WildToolBench: なぜ現実世界のツール利用においてLLMのセッション精度は15%を超えないのか
- LLMの信頼度とキャリブレーション:研究が実際に示していることの調査
- JSONSchemaBench: 現実世界のスキーマの複雑さがLLMの構造化出力の保証を破壊する
- FinMCP-Bench: MCP下での実世界の金融ツール利用に向けたLLMエージェントのベンチマーク
- FinTrace:金融タスクにおけるLLMツール呼び出しのトラジェクトリレベル評価
- FinToolBench:実世界の金融ツール使用におけるLLMエージェントの評価
- OmniEval: 金融分野向け全方位型RAG評価ベンチマーク
- LLM異常検知サーベイ (NAACL 2025):強力な分類体系、欠如した表形式データへの対応
- Found in the Middle: 位置的アテンションバイアスの校正によるロングコンテキストRAGの改善
- LLMエージェントにおける不確実性を考慮したディフェラル:小規模モデルから大規模モデルへいつエスカレーションすべきか
- OpenHands:AIソフトウェアエージェントのためのオープンプラットフォームと、それが財務自動化に意味すること
Beancount
Beancount ledger format, tooling, and ecosystem research
- あなたのエージェントはこれらの帳簿を一致させられますか?
- FinRAGBench-V:金融領域における視覚的引用を伴うマルチモーダルRAG
- LLMエージェントはCFOになれるのか?EnterpriseArenaによる132ヶ月のシミュレーションで明らかになった大きな格差
- WildToolBench: なぜ現実世界のツール利用においてLLMのセッション精度は15%を超えないのか
- JSONSchemaBench: 現実世界のスキーマの複雑さがLLMの構造化出力の保証を破壊する
- FinMCP-Bench: MCP下での実世界の金融ツール利用に向けたLLMエージェントのベンチマーク
- FinTrace:金融タスクにおけるLLMツール呼び出しのトラジェクトリレベル評価
- FinToolBench:実世界の金融ツール使用におけるLLMエージェントの評価
- OmniEval: 金融分野向け全方位型RAG評価ベンチマーク
- LLM異常検知サーベイ (NAACL 2025):強力な分類体系、欠如した表形式データへの対応
- Found in the Middle: 位置的アテンションバイアスの校正によるロングコンテキストRAGの改善
- LLMエージェントにおける不確実性を考慮したディフェラル:小規模モデルから大規模モデルへいつエスカレーションすべきか
Automation
Automation techniques and tools for financial data processing workflows
- LLMエージェントはCFOになれるのか?EnterpriseArenaによる132ヶ月のシミュレーションで明らかになった大きな格差
- WildToolBench: なぜ現実世界のツール利用においてLLMのセッション精度は15%を超えないのか
- JSONSchemaBench: 現実世界のスキーマの複雑さがLLMの構造化出力の保証を破壊する
- FinMCP-Bench: MCP下での実世界の金融ツール利用に向けたLLMエージェントのベンチマーク
- FinTrace:金融タスクにおけるLLMツール呼び出しのトラジェクトリレベル評価
- FinToolBench:実世界の金融ツール使用におけるLLMエージェントの評価
- OmniEval: 金融分野向け全方位型RAG評価ベンチマーク
- Found in the Middle: 位置的アテンションバイアスの校正によるロングコンテキストRAGの改善
- LLMエージェントにおける不確実性を考慮したディフェラル:小規模モデルから大規模モデルへいつエスカレーションすべきか
- OpenHands:AIソフトウェアエージェントのためのオープンプラットフォームと、それが財務自動化に意味すること
- TableMaster:LLMを用いたテーブル理解のための適応的推論
- LLMを用いたゼロショット異常検知:GPT-4はテーブルデータでどのようなパフォーマンスを示すか
Data Science
Data science methods applied to financial datasets and accounting workflows
- FinRAGBench-V:金融領域における視覚的引用を伴うマルチモーダルRAG
- WildToolBench: なぜ現実世界のツール利用においてLLMのセッション精度は15%を超えないのか
- LLMの信頼度とキャリブレーション:研究が実際に示していることの調査
- FinToolBench:実世界の金融ツール使用におけるLLMエージェントの評価
- OmniEval: 金融分野向け全方位型RAG評価ベンチマーク
- LLM異常検知サーベイ (NAACL 2025):強力な分類体系、欠如した表形式データへの対応
- Found in the Middle: 位置的アテンションバイアスの校正によるロングコンテキストRAGの改善
- Fin-RATE:LLMは期間横断および企業横断の財務分析にいかに失敗するか
- FinDER: 実務のアナリストによるクエリが財務RAGにおける74%の再現率の乖離を露呈
- Lost in the Middle:LLMにおける位置バイアスと金融AIへの影響
- AD-LLMベンチマーク:GPT-4oがテキスト異常検知においてゼロショットで0.93以上のAUROCを達成
- CausalTAD: LLMによるテーブルデータの異常検知のための因果関係に基づく列順序付け
Finance
Financial research, analysis, and domain knowledge for accounting AI
- FinRAGBench-V:金融領域における視覚的引用を伴うマルチモーダルRAG
- LLMの信頼度とキャリブレーション:研究が実際に示していることの調査
- FinTrace:金融タスクにおけるLLMツール呼び出しのトラジェクトリレベル評価
- OmniEval: 金融分野向け全方位型RAG評価ベンチマーク
- FinDER: 実務のアナリストによるクエリが財務RAGにおける74%の再現率の乖離を露呈
- Lost in the Middle:LLMにおける位置バイアスと金融AIへの影響
- AnoLLM: 財務データにおけるテーブルデータの異常検知に向けたLLMのファインチューニング
- DocFinQA:完全なSEC提出書類における長文コンテキストの財務推論
- TheAgentCompany:実世界の企業業務におけるLLMエージェントのベンチマーキング
- InvestorBench: Qwen2.5-72B が株式で最高の46.15% CRを達成
- シングルエージェント:同等トークンでマルチホップにおいてMASに匹敵
- M3MAD-Bench:マルチエージェント討論はドメインやモダリティを越えて真に有効なのか?
Plain-Text Accounting
Research grounded in plain-text accounting formats and workflows
- あなたのエージェントはこれらの帳簿を一致させられますか?
- LLMエージェントにおける不確実性を考慮したディフェラル:小規模モデルから大規模モデルへいつエスカレーションすべきか
- OpenHands:AIソフトウェアエージェントのためのオープンプラットフォームと、それが財務自動化に意味すること
- LLMによるBeancount DSL生成の正解率は2.3%:LLMFinLiteracyベンチマーク
- TableMaster:LLMを用いたテーブル理解のための適応的推論
- τ²-bench:対話型AIエージェントにおけるデュアルコントロールのコストを測定する
- GAIAベンチマーク:最先端AIエージェントの真の実力を測定する
- WorkArena:LLMウェブエージェントは実社会のエンタープライズ知識労働でどのように機能するか
- τ-bench: 実世界のツール使用ドメインにおけるAIエージェントの信頼性の測定
- Chain-of-Table: LLM推論チェーンにおけるテーブルの進化
- TableLlama: 7Bのオープンモデルはテーブル理解においてGPT-4に匹敵するか?
- TAPAS: SQL不要の弱教師ありテーブルQA、そしてそれがBeancountに意味すること
研究への取り組み方
プレーンテキスト優先
プレーンテキストの帳簿を出発点に、入力データを読みやすく、持ち運べて、検証できる形に保ちます。
デフォルトで再現可能
入力、手法、限界を明示し、他の人が研究を検討して発展させられるようにします。
オープンな発見
研究ノートを公開し、コミュニティによる結果への問いかけ、発展、改善を歓迎します。
研究をフォローする
公開済みのノートを読み、研究ログで次の問いを追いかけてください。