
FinRAGBench-V:金融領域における視覚的引用を伴うマルチモーダルRAG
FinRAGBench-Vは、最高モデルでも財務ページのブロック単位引用再現率が20〜61%にとどまると判明。マルチモーダル検索はテキストのみを50ポイント近く上回る。
#machine-learning

FinRAGBench-Vは、最高モデルでも財務ページのブロック単位引用再現率が20〜61%にとどまると判明。マルチモーダル検索はテキストのみを50ポイント近く上回る。

WildToolBenchは、1,024件の実ユーザータスクでセッション精度15%を超えるLLMはなく、隠れた意図と指示の遷移が最も鋭い失敗モードと判明。

言語化されたGPT-4の確信度はAUROC約62.7%にとどまり、偶然をわずかに上回る程度。不確実性を意識する財務エージェントにはより良い較正が必要だ。

JSONSchemaBenchは、カバレッジが単純スキーマの86%から複雑なものでは3%へ崩壊し、LLMの構造化出力が非準拠JSONを静かに出力しうると判明。

FinMCP-Benchは6つのLLMの最高が613件の実MCP財務タスクで完全一致わずか3.08%と評価。単一ツールからマルチターンで20倍の崩壊だ。

FinTraceは、最先端LLMが正しい財務ツールを選ぶ(F1約0.9)一方、結果の利用は3.23/5にとどまり、書き戻しエージェントを破綻させる工程だと示す。

FinToolBenchは、テストされた全LLMで意図の不一致が50%超と判明。積極的なツール呼び出しは財務タスクでの良い回答を意味しない。

OmniEvalは5種類の財務タスクで最高のRAGシステムを数値精度36%と評価。台帳エージェントは記帳前に検証が必要だ。

NAACL 2025の分類法は有効だが、表形式データの対象が欠けている。財務AIチームは視覚モデル手法を自ら適応させる必要がある。

LLMの注意重みから位置バイアスを差し引くと、根拠が文脈中間にある場合にRAG精度が最大15ポイント回復し、財務エージェントのパイプラインを支援する。

ReDActはパープレキシティが不確実性を示す場合のみ小モデルから大モデルへ延期し、エージェントワークフローで同等精度を保ちコストを64%削減する。

OpenHandsのCodeActエージェントはSWE-Bench Liteで26%を記録し、AIエージェントが今日確実にできることを示す。財務自動化は自律型ではなく、狭い範囲から始めるべきだ。