
あなたのエージェントはこれらの帳簿を一致させられますか?
1回のエージェント実行が3行の台帳を2958.50 USDの当座預金と1958.50 USDの9月利益に照合し、自ら診断した1件の失敗から回復した。
#plain-text-accounting

1回のエージェント実行が3行の台帳を2958.50 USDの当座預金と1958.50 USDの9月利益に照合し、自ら診断した1件の失敗から回復した。

ReDActはパープレキシティが不確実性を示す場合のみ小モデルから大モデルへ延期し、エージェントワークフローで同等精度を保ちコストを64%削減する。

OpenHandsのCodeActエージェントはSWE-Bench Liteで26%を記録し、AIエージェントが今日確実にできることを示す。財務自動化は自律型ではなく、狭い範囲から始めるべきだ。

LLMFinLiteracyは、5つの約7Bモデルが正しいBeancount取引を書けるのはわずか2.3%で、構文ではなく会計推論で失敗すると判明。

TableMasterはGPT-4o-miniでWikiTQの78.13%を達成し、Chain-of-Tableを13ポイント上回る。table-of-focusと適応的推論により、Beancount台帳上のエージェントを実現。

τ²-benchは独自ツールを持つアクティブユーザーが会話エージェントの成功率を18〜25ポイント下げると判明。書き込み権限を共有するBeancountエージェントも同様に敗れる。

GAIAの466タスクで最先端AIエージェントは74.55%、人間は92%。レベル3の調整が依然として最も難しいギャップだ。

WorkArenaの33のServiceNowタスクでGPT-4oは総合42.7%だがリストフィルタは0%。構造化UI操作が越えるべき壁だ。

τ-benchはトップLLMが小売ツール使用タスクでpass@1 0.692からpass@4 0.462へ低下すると判明。台帳に書き戻すエージェントも同じ一貫性の崖に直面する。

Chain-of-TableはWikiTQで67.31%、テキストのみのchain-of-thoughtは61.48%。4,000トークン超の表では10.25ポイントリードする。

TableLlamaは列型注釈でGPT-4に勝利(F1 94対32)するが、WikiTQの合成的推論では33ポイント劣る。

TAPASはSQLを生成せずセルを選択して表の質問に答える。小規模なBeancount台帳クエリには適するが規模拡大で破綻する。