
あなたのエージェントはこれらの帳簿を一致させられますか?
1回のエージェント実行が3行の台帳を2958.50 USDの当座預金と1958.50 USDの9月利益に照合し、自ら診断した1件の失敗から回復した。
#reconciliation

1回のエージェント実行が3行の台帳を2958.50 USDの当座預金と1958.50 USDの9月利益に照合し、自ら診断した1件の失敗から回復した。

FinRAGBench-Vは、最高モデルでも財務ページのブロック単位引用再現率が20〜61%にとどまると判明。マルチモーダル検索はテキストのみを50ポイント近く上回る。

EnterpriseArenaの132ヶ月CFO実行で80%生き残ったのはQwen3.5-9Bのみ。GPT-5.4とDeepSeek-V3.1は0%だった。台帳照合の省略が失敗の原因だ。

FinMCP-Benchは6つのLLMの最高が613件の実MCP財務タスクで完全一致わずか3.08%と評価。単一ツールからマルチターンで20倍の崩壊だ。

LLMの注意重みから位置バイアスを差し引くと、根拠が文脈中間にある場合にRAG精度が最大15ポイント回復し、財務エージェントのパイプラインを支援する。

Fin-RATEは、LLMの精度が経時追跡で18.60%に崩壊することを示す。制約となるボトルネックはモデルではなく検索パイプラインにある。

Voyagerの永続的なコードスキルライブラリは、微調整なしで既存のSOTAよりも3.3倍多くのMinecraftアイテムを発見——再利用パターンの台帳エージェントが必要とするもの。

AutoGenの2エージェント会話はMATH精度を55%から69%に引き上げ、SafeGuardエージェントは安全でないコードの検出で最大35 F1ポイントを追加する。

CodeActはJSONツール呼び出しを実行可能なPythonに置き換え、GPT-4エージェントの成功率を約20ポイント上げ、ターン数を30%削減します。

CRITICはLLMの修正を自身ではなく外部ツールで検証し、オープンドメインQAを7.7 F1向上、有害性を79.2%削減します。

ReActは推論とツール操作を交互に行い、事実検証で純粋なCoTを34ポイント上回ります。その失敗モードがBeancount台帳に書き込むエージェントを形作ります。