
LLMによるBeancount DSL生成の正解率は2.3%:LLMFinLiteracyベンチマーク
LLMFinLiteracyは、5つの約7Bモデルが正しいBeancount取引を書けるのはわずか2.3%で、構文ではなく会計推論で失敗すると判明。
#transaction-validation

LLMFinLiteracyは、5つの約7Bモデルが正しいBeancount取引を書けるのはわずか2.3%で、構文ではなく会計推論で失敗すると判明。

GuardAgentはPythonコードを実行してLLMエージェントのポリシーを施行し、タスク失敗なしで98.7%の精度を達成する。プロンプトルールでは81%で最大71%が失敗する。

マルチエージェント討論は算術で14.8ポイントを獲得したが、同等予算の単一エージェントがそれに匹敵する。これは台帳コミット前の安全チェックとしての討論を制限する。

CRITICはLLMの修正を自身ではなく外部ツールで検証し、オープンドメインQAを7.7 F1向上、有害性を79.2%削減します。