
FinRAGBench-V:金融領域における視覚的引用を伴うマルチモーダルRAG
FinRAGBench-Vは、最高モデルでも財務ページのブロック単位引用再現率が20〜61%にとどまると判明。マルチモーダル検索はテキストのみを50ポイント近く上回る。
#data-science

FinRAGBench-Vは、最高モデルでも財務ページのブロック単位引用再現率が20〜61%にとどまると判明。マルチモーダル検索はテキストのみを50ポイント近く上回る。

WildToolBenchは、1,024件の実ユーザータスクでセッション精度15%を超えるLLMはなく、隠れた意図と指示の遷移が最も鋭い失敗モードと判明。

言語化されたGPT-4の確信度はAUROC約62.7%にとどまり、偶然をわずかに上回る程度。不確実性を意識する財務エージェントにはより良い較正が必要だ。

FinToolBenchは、テストされた全LLMで意図の不一致が50%超と判明。積極的なツール呼び出しは財務タスクでの良い回答を意味しない。

OmniEvalは5種類の財務タスクで最高のRAGシステムを数値精度36%と評価。台帳エージェントは記帳前に検証が必要だ。

NAACL 2025の分類法は有効だが、表形式データの対象が欠けている。財務AIチームは視覚モデル手法を自ら適応させる必要がある。

LLMの注意重みから位置バイアスを差し引くと、根拠が文脈中間にある場合にRAG精度が最大15ポイント回復し、財務エージェントのパイプラインを支援する。

Fin-RATEは、LLMの精度が経時追跡で18.60%に崩壊することを示す。制約となるボトルネックはモデルではなく検索パイプラインにある。

FinDERの5,703件の実アナリストクエリで、最高のRAGは10-K根拠のわずか25.95%を再現。埋め込みを替える前に、まず略語を正規化せよ。

LLMは答えが文脈の中間にあると最大20ポイント低くスコアリングするため、金融RAGパイプラインは最良の箇所を最初か最後に配置すべきだ。

AD-LLMはGPT-4oがテキスト異常検知でゼロショットAUROC 0.93〜0.99を達成するが、金融監査AIではLLMモデル選択が依然信頼できないと判明。

CausalTADはLLMシリアライズ前に因果依存関係で表の列を並べ替え、AnoLLMに対する平均AUC-ROCを0.803から0.834に引き上げる。