
TAT-QA:財務年次報告書の推論のための表・テキスト・ハイブリッド型QAベンチマーク
TAT-QAは、表とテキストが混在する財務報告書のコンテキストに基づいた16,552問のベンチマークです。財務AIにおける核心的なボトルネックは、計算能力ではなく「根拠の特定(グラウンディング)」であることを示しました。2024年までに、微調整された7B LLMはF1スコア83%に達し、人間の上限である91%との差を大幅に縮めています。

TAT-QAは、表とテキストが混在する財務報告書のコンテキストに基づいた16,552問のベンチマークです。財務AIにおける核心的なボトルネックは、計算能力ではなく「根拠の特定(グラウンディング)」であることを示しました。2024年までに、微調整された7B LLMはF1スコア83%に達し、人間の上限である91%との差を大幅に縮めています。

FinQA (EMNLP 2021) は、多段階の算術プログラムを必要とするS&P 500の決算報告書から8,281個のQAペアを構築しました。リリース時、ニューラルモデルのスコアは61%であったのに対し、人間の専門家は91%でした。3段階以上のプログラムでは精度が22%にまで急落します。ドメイン定数、クロスモダリティのグラウンディング、推論チェーンの長さといった失敗のパターンは、今日のBeancountエージェントが直面している課題に直結しています。

FinanceBenchは、実際のSEC提出書類から抽出された10,231個の質問に対して16種類のAI構成を評価しました。共有ベクトルストアRAGの正解率はわずか19%であり、正解が含まれるパッセージを提示したGPT-4-Turboでさえ精度は85%にとどまりました。これは、エンタープライズ財務AIにとっての制約が検索ではなく数値推論であることを示しています。

DSPyは、手作業で作成されたプロンプト文字列を宣言的なシグネチャとメトリクス主導のコンパイラに置き換えます。これにより、GSM8Kの数学的推論においてLlama2-13bの精度を9.4%から46.9%に向上させ、本番環境の財務AIパイプラインにおいてより保守性の高いパスを提供します。

LATS(Language Agent Tree Search、ICML 2024)は、ReAct・Tree of Thoughts・Reflexionを単一のMCTSフレームワークに統合し、GPT-4でHumanEvalのpass@1 92.7%を達成。git管理されたBeancount台帳では、LATSを本番運用で制約する状態復元要件が簡単に満たされる。

Self-RAG(ICLR 2024 Oral)は、言語モデルがいつ検索を行うかを自ら決定し、4つの反省トークンを使用して自らの結果を評価するようにトレーニングする手法です。PopQAで55.8%、伝記のFactScoreで80.2を達成し、5つのベンチマークでChatGPTを上回りました。この分析では、そのメカニズム、アブレーション結果、再現性の限界、およびBeancount元帳を利用する金融AIエージェントへの影響について解説します。

Voyagerの永続的なコードスキルライブラリは、微調整なしで既存のSOTAよりも3.3倍多くのMinecraftアイテムを発見——再利用パターンの台帳エージェントが必要とするもの。

HippoRAG の OpenIE+PageRank メモリは、2WikiMultiHopQA で 89.1% の Recall@5 を達成し、ColBERTv2 の 68.2% を上回る — 複数年にわたる台帳のためのパス認識型検索。

AgentBench(Liuら、ICLR 2024)は、8つの対話環境で27のLLMをベンチマーク評価 — GPT-4は総合4.01、最良のオープンソースモデルは0.96。3つの支配的な障害モード(ナレッジグラフ障害の67.9%でタスク上限超過、データベース障害の53.3%でフォーマットエラー、無効なアクション)は、実台帳にBeancount書き戻しエージェントを展開する際のリスクに直接対応する。

Bloomberg は 5,690 億トークンの金融データで 500 億パラメータの LLM をトレーニングし、感情分析やテーブル推論のベンチマークで汎用モデルを上回りました。しかし、その後 GPT-4 が金融特化の事前学習なしでそれに匹敵する性能を示しました。この 1,000 万ドルの実験が明らかにしたドメイン事前学習のトレードオフ、数値のトークン化、そしてなぜ会計エージェントにとってツールの利用がモデル内部よりも信頼できるのかについて解説します。

AutoGen (Wu et al., 2023) は、LLMベースのエージェントがメッセージをやり取りしてタスクを完了するマルチエージェント対話フレームワークを導入しました。2つのエージェント構成により、MATHベンチマークの精度が55%から69%に向上し、専用のSafeGuardエージェントによって安全でないコードの検出が最大35 F1ポイント改善されました。これらの知見は、安全でモジュール化されたBeancount自動化パイプラインの構築に直接応用可能です。

Gorilla(Patilら、NeurIPS 2024)は、検索されたAPIドキュメントを用いて検索を意識した学習(RAT)で7BのLLaMAモデルを微調整し、GPT-4のゼロショットと比較してハルシネーション率を78%から11%に削減しました。これは、勘定科目名の誤りや符号の反転が単なる不快感ではなく正確性の致命的な欠陥となる、金融AIの書き戻しエージェントにとって直接的な意義を持ちます。