
LLM異常検知サーベイ (NAACL 2025):強力な分類体系、欠如した表形式データへの対応
NAACL 2025の分類法は有効だが、表形式データの対象が欠けている。財務AIチームは視覚モデル手法を自ら適応させる必要がある。
#analytics

NAACL 2025の分類法は有効だが、表形式データの対象が欠けている。財務AIチームは視覚モデル手法を自ら適応させる必要がある。

Fin-RATEは、LLMの精度が経時追跡で18.60%に崩壊することを示す。制約となるボトルネックはモデルではなく検索パイプラインにある。

LLMは答えが文脈の中間にあると最大20ポイント低くスコアリングするため、金融RAGパイプラインは最良の箇所を最初か最後に配置すべきだ。

AD-LLMはGPT-4oがテキスト異常検知でゼロショットAUROC 0.93〜0.99を達成するが、金融監査AIではLLMモデル選択が依然信頼できないと判明。

τ-benchはトップLLMが小売ツール使用タスクでpass@1 0.692からpass@4 0.462へ低下すると判明。台帳に書き戻すエージェントも同じ一貫性の崖に直面する。

ConvFinQAの最良モデルの実行精度は68.9%で、人間の専門家の89.4%に対して21ポイントの差があり、マルチターンの台帳チャットが直面する課題を示しています。

FinanceBenchは実際のSEC提出書類の10,231問で16のAI構成を検証:共有ベクターストアRAGは19%しか正解せず、検索がボトルネックではないことがわかる。

自己一貫性は1回の貪欲デコードではなく多数のサンプリング推論経路を多数決し、追加訓練なしでGSM8Kで17.9ポイント向上させます。