
LLM 在 Beancount DSL 生成中得分仅为 2.3%:LLMFinLiteracy 基准测试
LLMFinLiteracy发现,五个约7B模型正确编写Beancount交易的比例仅为2.3%,失败在于会计推理而非语法。
#transaction-validation

LLMFinLiteracy发现,五个约7B模型正确编写Beancount交易的比例仅为2.3%,失败在于会计推理而非语法。

GuardAgent enforces LLM agent policies by running Python code, hitting 98.7% accuracy with no task failures, versus 81% and up to 71% failure for prompt rules.

多智能体辩论在算术上提升 14.8 分,但同等算力的单一智能体也能达到。这限制了辩论作为账本提交前安全检查的作用。

CRITIC 通过外部工具而非模型自身来验证 LLM 修订,使开放域问答 F1 提升 7.7,毒性降低 79.2%。