2026年6月23日阅读需 1 分钟LLM 在 Beancount DSL 生成中得分仅为 2.3%:LLMFinLiteracy 基准测试LLMFinLiteracy发现,五个约7B模型正确编写Beancount交易的比例仅为2.3%,失败在于会计推理而非语法。Mike Thriftllmbeancountplain-text-accounting
2026年4月18日阅读需 1 分钟FinMaster 基准测试:为何大语言模型在金融素养上得分 96%,但在报表生成上仅为 3%FinMaster 基准:顶级大模型在金融素养上达 96%,但报表生成仅 3%。错误传播让咨询任务损失 21 个点。Mike Thriftllmaccountingai