
Fusion-in-Decoder: 複数パッセージの検索が生成型QAをどのように改善するか
IzacardとGraveによるFiDアーキテクチャは、検索されたパッセージを独立してエンコードし、デコーダーで融合させることで、NQおよびTriviaQAにおいてRAG-Sequenceを4〜11ポイント上回りました。本記事では、その設計と、トランザクションをまたぐ複数エントリの統合が一般的であるBeancountの元帳QAへの影響について考察します。

IzacardとGraveによるFiDアーキテクチャは、検索されたパッセージを独立してエンコードし、デコーダーで融合させることで、NQおよびTriviaQAにおいてRAG-Sequenceを4〜11ポイント上回りました。本記事では、その設計と、トランザクションをまたぐ複数エントリの統合が一般的であるBeancountの元帳QAへの影響について考察します。

GuardAgent(ICML 2025)は、ターゲットエージェントと環境の間に独立したLLMエージェントを配置し、Pythonコードを生成・実行することで提案されたすべてのアクションを検証します。これにより、プロンプトに埋め込まれた安全ルールでは81%の精度と29〜71%のタスク失敗率であったのに対し、98.7%のポリシー遵守精度を達成しながら100%のタスク完了率を維持します。

Du氏らによるICML 2024のマルチエージェント討論論文(算術において14.8ポイントの精度向上を報告)の精読。予算を等しくした単一エージェントが討論のパフォーマンスに匹敵することを示す2025年の反論論文と併せて、討論の失敗の65%を占める「集団的妄想」がAI支援による元帳コミットに与える特有のリスクを分析します。

NeurIPS 2024のSpotlight論文が、OneFitsAll、Time-LLM、CALFという3つのLLMベースの時系列予測手法をアブレーション解析した結果、言語モデルを取り除くことで多くの場合精度が向上し、学習速度が最大1,383倍高速化することが判明しました。Beancountの残高予測などの金融AIアプリケーションでは、転用されたLLMよりも軽量な専用モデルが一貫して優れた結果を出しています。

AuditCopilotは、オープンソースのLLM(Mistral-8B、Gemma、Llama-3.1)を企業の仕訳不正検知に適用し、誤検知を942件から12件に削減しました。しかし、アブレーション研究により、LLMは独立した異常検知器としてではなく、主にIsolation Forestスコアの上層にある統合レイヤーとして機能していることが明らかになりました。

TAT-LLMは、財務表とテキストのQAベンチマークにおいてLoRAを用いてLLaMA 2 7Bを微調整し、推論を決定論的な「抽出・推論・実行」のステップに分解することで、FinQAで64.60%のEM(厳密一致)を達成し、算術エラーを排除してGPT-4の63.91%を上回りました。

70億パラメータのLLMを用いたRAGと教師なしファインチューニングの実証的な比較により、RAGはカットオフ後の事実に対して0.875以上の精度を達成する一方、ファインチューニングは0.504で停滞することが示されました。これはBeancountエージェントの設計や、頻繁な知識更新を必要とするシステムに直接的な影響を与えます。

IRCoTは、BM25検索と思考の連鎖(CoT)推論ループの各ステップをインターリーブさせることで、HotpotQAにおいて1ステップのRAGを上回る+11.3の検索リコールと+7.1のF1スコアを達成しました。また、適切な検索戦略があれば、3BモデルがGPT-3 175Bを凌駕できることを示しています。

FLARE(EMNLP 2023)は、トークン確率の確信度しきい値を使用して生成の途中で検索をトリガーすることにより、標準的なRAGを改善します。2WikiMultihopQAにおいて、単一検索の39.4に対し51.0 EMに達しますが、指示調整済みチャットモデルにおけるキャリブレーションの失敗が、本番環境の金融エージェントとしての信頼性を制限しています。

Lewisらは凍結されたFAISSインデックスでNatural Questionsに対して44.5 EMを達成。Beancountの台帳では残高が毎日変わるとき、再インデックスしないと見逃しが生じることを意味します。

MultiHiertt (ACL 2022) は、1文書あたり平均3.89個の階層構造テーブルを含む実際の財務報告書から10,440組のQAペアを導入しました。最新モデルのF1スコアは人間の87%に対し38%に留まり、複数テーブルにまたがる質問では15ポイント低下します。これは財務AIが克服すべき検索精度のギャップを定量化しています。

ConvFinQAの最良モデルの実行精度は68.9%で、人間の専門家の89.4%に対して21ポイントの差があり、マルチターンの台帳チャットが直面する課題を示しています。