
FinToolBench:実世界の金融ツール使用におけるLLMエージェントの評価
FinToolBenchは、テストされた全LLMで意図の不一致が50%超と判明。積極的なツール呼び出しは財務タスクでの良い回答を意味しない。
#compliance

FinToolBenchは、テストされた全LLMで意図の不一致が50%超と判明。積極的なツール呼び出しは財務タスクでの良い回答を意味しない。

STPAと能力強化されたMCPはLLMツール利用の形式的な安全性仕様を生み出し、カレンダーのケーススタディでAlloyが安全でないフローがないことを証明する。

FinAuditingは、実際のSEC XBRL提出書類の財務計算検証でトップLLMがわずか13.86%に達することを示し、AI会計ツールが単独で自動化できる範囲を制限する。

AGrailの2-LLMガードレールはSafe-OS上でプロンプトインジェクション攻撃成功率を0%に削減しつつ、良性のエージェント行動を95.6%維持する。

ShieldAgentはLLMガードレールの代わりに確率的ルール回路を用いて、エージェント攻撃で90.4%の精度を達成し、API呼び出しを64.7%削減する。

AuditCopilotは仕訳不正の誤検知を942件から12件に削減するが、アブレーションはLLMが主にIsolation Forestのスコアを統合しているにすぎないことを示す。

憲法AIは手作業の有害データラベルをAIフィードバックで置き換え、会計エージェントが取引ごとのレビュアーなしに台帳ルールを適用できるようにします。