近期研究笔记
来自 Bean Labs 的开放实验与发现——由 Beancount.io 发起的 Finance AI Agent 研究计划。
按主题研究
浏览我们最常关注的主题对应的研究日志。
LLM
Large language model research with applications in financial tasks
- 你的智能体能否平衡这些账目?
- FinRAGBench-V:金融领域带视觉引用的多模态 RAG
- LLM 智能体能担任 CFO 吗?EnterpriseArena 132 个月的模拟揭示了巨大差距
- WildToolBench:为何在真实世界工具调用中没有 LLM 的会话准确率能超过 15%
- LLM 置信度与校准:研究现状深度综述
- JSONSchemaBench:真实世界的模式复杂度打破了大语言模型结构化输出的保证
- FinMCP-Bench:MCP 架构下真实世界金融工具使用的大语言模型代理基准测试
- FinTrace:针对金融任务的 LLM 工具调用轨迹级评估
- FinToolBench:评估LLM代理在真实金融工具使用中的表现
- OmniEval:金融领域全方位 RAG 评估基准
- LLM 异常检测综述 (NAACL 2025):强大的分类体系,缺失的表格数据覆盖
- 发现于中:通过校准位置注意力偏差提升长上下文 RAG
AI
Artificial intelligence research and applications in finance and accounting
- FinRAGBench-V:金融领域带视觉引用的多模态 RAG
- LLM 智能体能担任 CFO 吗?EnterpriseArena 132 个月的模拟揭示了巨大差距
- WildToolBench:为何在真实世界工具调用中没有 LLM 的会话准确率能超过 15%
- LLM 置信度与校准:研究现状深度综述
- JSONSchemaBench:真实世界的模式复杂度打破了大语言模型结构化输出的保证
- FinMCP-Bench:MCP 架构下真实世界金融工具使用的大语言模型代理基准测试
- FinTrace:针对金融任务的 LLM 工具调用轨迹级评估
- FinToolBench:评估LLM代理在真实金融工具使用中的表现
- OmniEval:金融领域全方位 RAG 评估基准
- LLM 异常检测综述 (NAACL 2025):强大的分类体系,缺失的表格数据覆盖
- 发现于中:通过校准位置注意力偏差提升长上下文 RAG
- 面向 LLM 智能体的不确定性感知委派:何时从小型模型切换到大型模型
Machine Learning
Machine learning techniques for financial data analysis and automation
- FinRAGBench-V:金融领域带视觉引用的多模态 RAG
- WildToolBench:为何在真实世界工具调用中没有 LLM 的会话准确率能超过 15%
- LLM 置信度与校准:研究现状深度综述
- JSONSchemaBench:真实世界的模式复杂度打破了大语言模型结构化输出的保证
- FinMCP-Bench:MCP 架构下真实世界金融工具使用的大语言模型代理基准测试
- FinTrace:针对金融任务的 LLM 工具调用轨迹级评估
- FinToolBench:评估LLM代理在真实金融工具使用中的表现
- OmniEval:金融领域全方位 RAG 评估基准
- LLM 异常检测综述 (NAACL 2025):强大的分类体系,缺失的表格数据覆盖
- 发现于中:通过校准位置注意力偏差提升长上下文 RAG
- 面向 LLM 智能体的不确定性感知委派:何时从小型模型切换到大型模型
- OpenHands:AI 软件代理开放平台及其对财务自动化的意义
Beancount
Beancount ledger format, tooling, and ecosystem research
- 你的智能体能否平衡这些账目?
- FinRAGBench-V:金融领域带视觉引用的多模态 RAG
- LLM 智能体能担任 CFO 吗?EnterpriseArena 132 个月的模拟揭示了巨大差距
- WildToolBench:为何在真实世界工具调用中没有 LLM 的会话准确率能超过 15%
- JSONSchemaBench:真实世界的模式复杂度打破了大语言模型结构化输出的保证
- FinMCP-Bench:MCP 架构下真实世界金融工具使用的大语言模型代理基准测试
- FinTrace:针对金融任务的 LLM 工具调用轨迹级评估
- FinToolBench:评估LLM代理在真实金融工具使用中的表现
- OmniEval:金融领域全方位 RAG 评估基准
- LLM 异常检测综述 (NAACL 2025):强大的分类体系,缺失的表格数据覆盖
- 发现于中:通过校准位置注意力偏差提升长上下文 RAG
- 面向 LLM 智能体的不确定性感知委派:何时从小型模型切换到大型模型
Automation
Automation techniques and tools for financial data processing workflows
- LLM 智能体能担任 CFO 吗?EnterpriseArena 132 个月的模拟揭示了巨大差距
- WildToolBench:为何在真实世界工具调用中没有 LLM 的会话准确率能超过 15%
- JSONSchemaBench:真实世界的模式复杂度打破了大语言模型结构化输出的保证
- FinMCP-Bench:MCP 架构下真实世界金融工具使用的大语言模型代理基准测试
- FinTrace:针对金融任务的 LLM 工具调用轨迹级评估
- FinToolBench:评估LLM代理在真实金融工具使用中的表现
- OmniEval:金融领域全方位 RAG 评估基准
- 发现于中:通过校准位置注意力偏差提升长上下文 RAG
- 面向 LLM 智能体的不确定性感知委派:何时从小型模型切换到大型模型
- OpenHands:AI 软件代理开放平台及其对财务自动化的意义
- TableMaster:基于大语言模型的表格理解自适应推理
- 利用大语言模型进行零样本异常检测:GPT-4 在表格数据上的表现
Data Science
Data science methods applied to financial datasets and accounting workflows
- FinRAGBench-V:金融领域带视觉引用的多模态 RAG
- WildToolBench:为何在真实世界工具调用中没有 LLM 的会话准确率能超过 15%
- LLM 置信度与校准:研究现状深度综述
- FinToolBench:评估LLM代理在真实金融工具使用中的表现
- OmniEval:金融领域全方位 RAG 评估基准
- LLM 异常检测综述 (NAACL 2025):强大的分类体系,缺失的表格数据覆盖
- 发现于中:通过校准位置注意力偏差提升长上下文 RAG
- Fin-RATE:大语言模型在跨周期和跨实体财务分析中的失败表现
- FinDER:真实分析师查询揭示金融 RAG 中 74% 的召回率差距
- 迷失在中间:大语言模型中的位置偏差及其对金融 AI 的影响
- AD-LLM 基准测试:GPT-4o 在文本异常检测中零样本 AUROC 达到 0.93+
- CausalTAD:用于大语言模型表格异常检测的因果列排序
Finance
Financial research, analysis, and domain knowledge for accounting AI
- FinRAGBench-V:金融领域带视觉引用的多模态 RAG
- LLM 置信度与校准:研究现状深度综述
- FinTrace:针对金融任务的 LLM 工具调用轨迹级评估
- OmniEval:金融领域全方位 RAG 评估基准
- FinDER:真实分析师查询揭示金融 RAG 中 74% 的召回率差距
- 迷失在中间:大语言模型中的位置偏差及其对金融 AI 的影响
- AnoLLM:针对金融数据表格式异常检测的 LLM 微调
- DocFinQA:基于完整 SEC 申报文件的长文本财务推理
- TheAgentCompany:在真实企业任务中评估大语言模型智能体
- InvestorBench:Qwen2.5-72B以46.15%的CR登顶股票交易
- 单代理:在相同预算下,多跳任务上等于多智能体系统
- M3MAD-Bench:多智能体辩论在不同领域和模态下真的有效吗?
Plain-Text Accounting
Research grounded in plain-text accounting formats and workflows
- 你的智能体能否平衡这些账目?
- 面向 LLM 智能体的不确定性感知委派:何时从小型模型切换到大型模型
- OpenHands:AI 软件代理开放平台及其对财务自动化的意义
- LLM 在 Beancount DSL 生成中得分仅为 2.3%:LLMFinLiteracy 基准测试
- TableMaster:基于大语言模型的表格理解自适应推理
- τ²-bench:衡量对话式 AI 智能体中双重控制的成本
- GAIA 基准测试:衡量前沿 AI 智能体究竟能做些什么
- WorkArena:大语言模型(LLM)网络智能体在真实企业知识工作中的表现
- τ-bench:评估 AI 代理在现实世界工具调用领域的可靠性
- Chain-of-Table:LLM 推理链中的演进表格
- TableLlama:7B 开源模型在表格理解上能否媲美 GPT-4?
- TAPAS:无需 SQL 的弱监督表格问答及其对 Beancount 的意义
我们的研究方法
纯文本优先
从纯文本账簿出发,让输入数据保持可读、可移植,并接受检验。
默认可复现
明确说明输入、方法和局限,让其他人能够检验这项工作,并在此基础上继续探索。
开放发现
公开发布研究笔记,邀请社区质疑、拓展和改进研究发现。
关注研究进展
阅读已发布的笔记,并在研究日志中关注我们接下来探索的问题。