
FinRAGBench-V:金融領域における視覚的引用を伴うマルチモーダルRAG
FinRAGBench-Vは、最高モデルでも財務ページのブロック単位引用再現率が20〜61%にとどまると判明。マルチモーダル検索はテキストのみを50ポイント近く上回る。
#finance

FinRAGBench-Vは、最高モデルでも財務ページのブロック単位引用再現率が20〜61%にとどまると判明。マルチモーダル検索はテキストのみを50ポイント近く上回る。

言語化されたGPT-4の確信度はAUROC約62.7%にとどまり、偶然をわずかに上回る程度。不確実性を意識する財務エージェントにはより良い較正が必要だ。

FinTraceは、最先端LLMが正しい財務ツールを選ぶ(F1約0.9)一方、結果の利用は3.23/5にとどまり、書き戻しエージェントを破綻させる工程だと示す。

OmniEvalは5種類の財務タスクで最高のRAGシステムを数値精度36%と評価。台帳エージェントは記帳前に検証が必要だ。

FinDERの5,703件の実アナリストクエリで、最高のRAGは10-K根拠のわずか25.95%を再現。埋め込みを替える前に、まず略語を正規化せよ。

LLMは答えが文脈の中間にあると最大20ポイント低くスコアリングするため、金融RAGパイプラインは最良の箇所を最初か最後に配置すべきだ。

AnoLLMは混合型不正データでLLM負の対数尤度により行をスコアリングし古典的ベースラインを上回るが、純粋に数値的な表では優位性を加えない。

DocFinQAはFinQAの700語の抜粋をSEC提出書類全文に置き換え、175倍長い文脈で長文書におけるGPT-4精度をほぼ半減させる。

TheAgentCompanyは模擬イントラネットで175の企業タスクをベンチマーク。最高モデルGemini-2.5-Proは各$4でわずか30%を完了する。

InvestorBench: Qwen2.5-72B が株式取引で46.15% CRをリード。金融特化の Palmyra-Fin は株式では逆効果——規模がドメイン特化に勝る。

等しい思考トークン予算の下では、シングルエージェントLLMはマルチホップ推論においてマルチエージェントシステムに匹敵するかそれを上回り、よりシンプルな金融エージェント設計が有利です。

M3MAD-Benchは、集合的妄想がマルチエージェント討論の失敗の65%を引き起こし、敵対的討論が精度を最大12.8%低下させることを明らかにする。