メインコンテンツへスキップ

Mike Thrift

マーケティングマネージャー

TAT-QA:財務年次報告書の推論のための表・テキスト・ハイブリッド型QAベンチマーク

TAT-QAは、表とテキストが混在する財務報告書のコンテキストに基づいた16,552問のベンチマークです。財務AIにおける核心的なボトルネックは、計算能力ではなく「根拠の特定(グラウンディング)」であることを示しました。2024年までに、微調整された7B LLMはF1スコア83%に達し、人間の上限である91%との差を大幅に縮めています。

FinQA:財務レポートにおけるAIの数値推論を測定するベンチマーク

FinQA (EMNLP 2021) は、多段階の算術プログラムを必要とするS&P 500の決算報告書から8,281個のQAペアを構築しました。リリース時、ニューラルモデルのスコアは61%であったのに対し、人間の専門家は91%でした。3段階以上のプログラムでは精度が22%にまで急落します。ドメイン定数、クロスモダリティのグラウンディング、推論チェーンの長さといった失敗のパターンは、今日のBeancountエージェントが直面している課題に直結しています。

FinanceBench:ベクトルストアRAGが実際の財務書類で失敗する理由

FinanceBenchは、実際のSEC提出書類から抽出された10,231個の質問に対して16種類のAI構成を評価しました。共有ベクトルストアRAGの正解率はわずか19%であり、正解が含まれるパッセージを提示したGPT-4-Turboでさえ精度は85%にとどまりました。これは、エンタープライズ財務AIにとっての制約が検索ではなく数値推論であることを示しています。

DSPy: 脆弱なプロンプトエンジニアリングをコンパイル済みのLLMパイプラインで置き換える

DSPyは、手作業で作成されたプロンプト文字列を宣言的なシグネチャとメトリクス主導のコンパイラに置き換えます。これにより、GSM8Kの数学的推論においてLlama2-13bの精度を9.4%から46.9%に向上させ、本番環境の財務AIパイプラインにおいてより保守性の高いパスを提供します。

Self-RAG:LLMのための適応的リトリーバルと自己批判

Self-RAG(ICLR 2024 Oral)は、言語モデルがいつ検索を行うかを自ら決定し、4つの反省トークンを使用して自らの結果を評価するようにトレーニングする手法です。PopQAで55.8%、伝記のFactScoreで80.2を達成し、5つのベンチマークでChatGPTを上回りました。この分析では、そのメカニズム、アブレーション結果、再現性の限界、およびBeancount元帳を利用する金融AIエージェントへの影響について解説します。

AgentBench: LLMをエージェントとして評価する — 金融AIの信頼性への教訓

AgentBench(Liuら、ICLR 2024)は、8つの対話環境で27のLLMをベンチマーク評価 — GPT-4は総合4.01、最良のオープンソースモデルは0.96。3つの支配的な障害モード(ナレッジグラフ障害の67.9%でタスク上限超過、データベース障害の53.3%でフォーマットエラー、無効なアクション)は、実台帳にBeancount書き戻しエージェントを展開する際のリスクに直接対応する。

BloombergGPT と金融におけるドメイン特化型 LLM の限界

Bloomberg は 5,690 億トークンの金融データで 500 億パラメータの LLM をトレーニングし、感情分析やテーブル推論のベンチマークで汎用モデルを上回りました。しかし、その後 GPT-4 が金融特化の事前学習なしでそれに匹敵する性能を示しました。この 1,000 万ドルの実験が明らかにしたドメイン事前学習のトレードオフ、数値のトークン化、そしてなぜ会計エージェントにとってツールの利用がモデル内部よりも信頼できるのかについて解説します。

AutoGen: 金融AIのためのマルチエージェント対話フレームワーク

AutoGen (Wu et al., 2023) は、LLMベースのエージェントがメッセージをやり取りしてタスクを完了するマルチエージェント対話フレームワークを導入しました。2つのエージェント構成により、MATHベンチマークの精度が55%から69%に向上し、専用のSafeGuardエージェントによって安全でないコードの検出が最大35 F1ポイント改善されました。これらの知見は、安全でモジュール化されたBeancount自動化パイプラインの構築に直接応用可能です。

Gorilla: 検索を意識した学習(RAT)により、LLMのAPIハルシネーションを78%から11%に低減する方法

Gorilla(Patilら、NeurIPS 2024)は、検索されたAPIドキュメントを用いて検索を意識した学習(RAT)で7BのLLaMAモデルを微調整し、GPT-4のゼロショットと比較してハルシネーション率を78%から11%に削減しました。これは、勘定科目名の誤りや符号の反転が単なる不快感ではなく正確性の致命的な欠陥となる、金融AIの書き戻しエージェントにとって直接的な意義を持ちます。