メインコンテンツへスキップ
Beancount.io Logo

研究ログ

Bean Labs からのオープンな実験と発見 — Beancount.io による Finance AI Agent 研究イニシアチブ。

PHANTOM (NeurIPS 2025): 金融文書におけるLLMのハルシネーション検出の測定

PHANTOM(NeurIPS 2025)は、最大30,000トークンのコンテキスト長にわたる実際のSEC提出書類を用いて、LLMのハルシネーション検出を測定する初のベンチマークです。Qwen3-30B-A3B-ThinkingがF1=0.882でリードしており、7Bモデルのスコアはランダムな推測に近く、これは自律型会計エージェントに直接的な影響を及ぼします。

FinMasterベンチマーク:LLMが金融リテラシーで96%を記録しながら財務諸表作成で3%に沈む理由

FinMaster (arXiv:2505.13533)は、183の金融タスクにおいてo3-mini、Claude 3.7 Sonnet、DeepSeek-V3をベンチマーク評価しました。その結果、モデルは金融リテラシーで96%を記録したものの、財務諸表作成では3%へと急落し、複数ステップのコンサルティングタスクでは誤差伝播により精度が21ポイント低下することが明らかになりました。

ReAct:言語モデルにおける推論と行動の相乗効果

ReAct (Yao et al., ICLR 2023) は、Chain-of-Thought(思考の連鎖)推論とツールのアクションを単一の軌跡に統合し、事実検証において純粋な CoT を、具現化タスクの模倣学習において 34 ポイント上回る成果を上げました。この分析では、検索による混乱や累積誤差といった論文の失敗モードを、Beancount 元帳へ書き戻しを行う自律型エージェントにとっての意味合いを含めて解説します。

Toolformer:自己教師ありツールの利用とその金融AIにおける限界

Toolformer (Meta AI, NeurIPS 2023) の精読:パープレキシティでフィルタリングされた自己教師あり学習により、67億パラメータのモデルに外部APIの呼び出しを学習させる方法、算術ベンチマークでGPT-3 175Bを上回る成果、そしてなぜそのシングルステップのアーキテクチャでは構造化された帳簿操作に必要な連鎖的なツール呼び出しをサポートできないのかを解説します。

FinBen: 36の財務タスクにおけるLLMのベンチマーク — 会計AIへの示唆

NeurIPS 2024で発表されたFinBenは、36の財務データセットにわたり15のLLMを評価し、GPT-4が数値的質問応答で0.63の完全一致、株価動向予測で0.54(ほぼ偶然レベル)に達したことを示しました。これらの数字が、Beancount帳簿上で信頼性の高い会計エージェントを構築する上で何を意味するのかを解説します。