
DIN-SQL: GPT-4がSpiderで67.4%→85.3% EXにジャンプ
DIN-SQLはスキーマリンクと自己補正ステージにより、Spiderの実行精度をGPT-4で67.4%から85.3%に引き上げます。同じ分解がBeancount BQLにも適用できます。

DIN-SQLはスキーマリンクと自己補正ステージにより、Spiderの実行精度をGPT-4で67.4%から85.3%に引き上げます。同じ分解がBeancount BQLにも適用できます。

BIRDにおいて、GPT-4はドメインヒントありで54.89%の実行精度、なしで34.88%—BeancountのNL→BQLインターフェースが埋めなければならない20ポイントの差。

CMUとノースカロライナ州立大学の研究者が、System-Theoretic Process Analysis(STPA)と機能強化されたModel Context Protocolを用いて、LLMエージェントのツール利用に関する形式的な安全仕様を導出することを提案。Alloyベースの検証により、カレンダースケジューリングのケーススタディにおいて安全でないフローが存在しないことを実証しています。

MicrosoftのGraphRAGはベクターRAGに対して72〜83%の理解向上をもたらすと発表されたが、2025年の監査で判定バイアスを修正するとその勝率は消滅——複数文書の台帳QAへの警鐘。

FinAuditingは、1,102件の実在するSEC XBRL提出事例を用いて13のLLMをゼロショットでテストしました。最高スコアは財務計算の検証で13.86%、コンセプト検索で12.42%にとどまりました。この結果は、外部ツールなしでAI会計ツールに自動化を任せられる範囲を直接的に制限するものです。

InvestorBench: Qwen2.5-72B が株式取引で46.15% CRをリード。金融特化の Palmyra-Fin は株式では逆効果——規模がドメイン特化に勝る。

StructRAG (ICLR 2025) は、推論前に各クエリを表、グラフ、カタログ、アルゴリズム、またはチャンクといったタスクに適した構造タイプにルーティングします。これにより、LoongベンチマークにおいてGraphRAGを28ポイント上回るスコアを記録しつつ、22倍の高速化を実現しました。DPOでトレーニングされたルーター単体で、15ポイントの精度向上に寄与しています。

等しい思考トークン予算の下では、シングルエージェントLLMはマルチホップ推論においてマルチエージェントシステムに匹敵するかそれを上回り、よりシンプルな金融エージェント設計が有利です。

M3MAD-Benchは、9つのモデル、5つのドメイン、および視覚と言語の設定においてマルチエージェント討論をストレステストしました。その結果、失敗の65%が「集団的妄想」に起因すること、敵対的討論により精度が最大12.8%低下すること、そして自己整合性が通常、より低いトークンコストで討論と同等の精度を達成することが判明しました。

AGrail(ACL 2025)は、テスト時適応(TTA)を通じて推論時に安全性チェックを適応させる2つのLLMによる協調型ガードレールを導入し、Safe-OSにおいてプロンプトインジェクション攻撃の成功率0%と正当なアクションの95.6%の保持を達成しました。これに対し、GuardAgentやLLaMA-Guardは正当なアクションを最大49.2%ブロックしてしまいます。

ShieldAgent (ICML 2025) は、LLMベースのガードレールをマルコフ論理ネットワーク上に構築された確率的ルール回路に置き換え、APIコールを64.7%削減しながらエージェント攻撃に対して90.4%の精度を達成しました。これが金融AIシステムにおける検証可能な安全性にとって何を意味するのかを解説します。

Atlas (JMLR 2023) は、わずか 64 個の学習例で Natural Questions において 42.4% の精度を達成し、11B パラメータでありながら PaLM 540B を 3 ポイント上回りました。これは、Contriever ベースの高密度検索機と T5 Fusion-in-Decoder 読解機を共同で事前学習することで実現されました。本分析では、検索精度の限界、587GB のインデックス・インフラコスト、および Beancount 元帳 QA システムへの影響について解説します。