
FinRAGBench-V:金融領域における視覚的引用を伴うマルチモーダルRAG
FinRAGBench-Vは、最高モデルでも財務ページのブロック単位引用再現率が20〜61%にとどまると判明。マルチモーダル検索はテキストのみを50ポイント近く上回る。
#financial-reporting

FinRAGBench-Vは、最高モデルでも財務ページのブロック単位引用再現率が20〜61%にとどまると判明。マルチモーダル検索はテキストのみを50ポイント近く上回る。

Fin-RATEは、LLMの精度が経時追跡で18.60%に崩壊することを示す。制約となるボトルネックはモデルではなく検索パイプラインにある。

FinDERの5,703件の実アナリストクエリで、最高のRAGは10-K根拠のわずか25.95%を再現。埋め込みを替える前に、まず略語を正規化せよ。

DocFinQAはFinQAの700語の抜粋をSEC提出書類全文に置き換え、175倍長い文脈で長文書におけるGPT-4精度をほぼ半減させる。

FinAuditingは、実際のSEC XBRL提出書類の財務計算検証でトップLLMがわずか13.86%に達することを示し、AI会計ツールが単独で自動化できる範囲を制限する。

TAT-LLMはLLaMA 2 7BをFinQAで64.60% EMに微調整し、GPT-4の63.91%を僅差で上回る。抽出-推論-実行パイプラインで小型モデルが表計算をこなす。

MultiHierttは、10,440の財務QAペアでモデルが38% F1に対し人間は87%であり、テーブル横断問題では15ポイント低下することを示す。

ConvFinQAの最良モデルの実行精度は68.9%で、人間の専門家の89.4%に対して21ポイントの差があり、マルチターンの台帳チャットが直面する課題を示しています。

TAT-QAの表とテキストのハイブリッド問題は、算術ではなく根拠づけが金融AIのボトルネックであることを示した。2024年までにファインチューニングされた7B LLMが83% F1に達した。

FinQAは、ニューラルモデルが財務報告書の計算で61%のスコアに対し人間の専門家は91%、3ステップ以上のプログラムでは22%まで崩壊することを明らかにした。

FinanceBenchは実際のSEC提出書類の10,231問で16のAI構成を検証:共有ベクターストアRAGは19%しか正解せず、検索がボトルネックではないことがわかる。

PHANTOM(NeurIPS 2025)は実際のSEC提出書類でLLM幻覚検出を測定。Qwen3-30BがF1=0.882で首位、しかし7Bモデルはほぼランダム推測です。