Bean Labs
Investigant els límits de la intel·ligència financera autònoma.
Una iniciativa de recerca de Beancount.io
Bean Labs publica notes de recerca obertes sobre comptabilitat autònoma: models de llenguatge que raonen sobre llibres majors de partida doble, produeixen pistes d'auditoria verificables i es mantenen ancorats en la comptabilitat de text pla.
Notes de recerca recents
Experiments i descobriments oberts de Bean Labs — la iniciativa de recerca Finance AI Agent de Beancount.io.
Recerca per tema
Explora el registre de recerca pels temes que més sovint tractem.
LLM
Large language model research with applications in financial tasks
- Pot el vostre agent equilibrar aquests llibres?
- FinRAGBench-V: RAG multimodal amb citacions visuals en l'àmbit financer
- Poden els agents LLM ser CFO? La simulació de 132 mesos d'EnterpriseArena revela una gran bretxa
- WildToolBench: Per què cap LLM supera el 15% de precisió de sessió en l'ús d'eines en el món real
- Confiança i calibratge en LLM: una enquesta sobre el que realment mostra la recerca
- JSONSchemaBench: La complexitat dels esquemes del món real trenca les garanties de sortida estructurada dels LLM
- FinMCP-Bench: Benchmarking d'agents LLM per a l'ús d'eines financeres del món real sota MCP
- FinTrace: Avaluació a nivell de trajectòria de la crida d'eines de LLM per a tasques financeres
- FinToolBench: Avaluació d'agents LLM en l'ús d'eines financeres del món real
- OmniEval: Banc de proves d'avaluació RAG omnidireccional per al domini financer
- Enquesta sobre detecció d'anomalies amb LLM (NAACL 2025): taxonomia forta, cobertura tabular absent
- Trobats al mig: el calibratge del biaix d'atenció posicional millora el RAG de context llarg
AI
Artificial intelligence research and applications in finance and accounting
- FinRAGBench-V: RAG multimodal amb citacions visuals en l'àmbit financer
- Poden els agents LLM ser CFO? La simulació de 132 mesos d'EnterpriseArena revela una gran bretxa
- WildToolBench: Per què cap LLM supera el 15% de precisió de sessió en l'ús d'eines en el món real
- Confiança i calibratge en LLM: una enquesta sobre el que realment mostra la recerca
- JSONSchemaBench: La complexitat dels esquemes del món real trenca les garanties de sortida estructurada dels LLM
- FinMCP-Bench: Benchmarking d'agents LLM per a l'ús d'eines financeres del món real sota MCP
- FinTrace: Avaluació a nivell de trajectòria de la crida d'eines de LLM per a tasques financeres
- FinToolBench: Avaluació d'agents LLM en l'ús d'eines financeres del món real
- OmniEval: Banc de proves d'avaluació RAG omnidireccional per al domini financer
- Enquesta sobre detecció d'anomalies amb LLM (NAACL 2025): taxonomia forta, cobertura tabular absent
- Trobats al mig: el calibratge del biaix d'atenció posicional millora el RAG de context llarg
- Transferència basada en la incertesa per a agents LLM: quan escalar de models petits a grans
Machine Learning
Machine learning techniques for financial data analysis and automation
- FinRAGBench-V: RAG multimodal amb citacions visuals en l'àmbit financer
- WildToolBench: Per què cap LLM supera el 15% de precisió de sessió en l'ús d'eines en el món real
- Confiança i calibratge en LLM: una enquesta sobre el que realment mostra la recerca
- JSONSchemaBench: La complexitat dels esquemes del món real trenca les garanties de sortida estructurada dels LLM
- FinMCP-Bench: Benchmarking d'agents LLM per a l'ús d'eines financeres del món real sota MCP
- FinTrace: Avaluació a nivell de trajectòria de la crida d'eines de LLM per a tasques financeres
- FinToolBench: Avaluació d'agents LLM en l'ús d'eines financeres del món real
- OmniEval: Banc de proves d'avaluació RAG omnidireccional per al domini financer
- Enquesta sobre detecció d'anomalies amb LLM (NAACL 2025): taxonomia forta, cobertura tabular absent
- Trobats al mig: el calibratge del biaix d'atenció posicional millora el RAG de context llarg
- Transferència basada en la incertesa per a agents LLM: quan escalar de models petits a grans
- OpenHands: Plataforma oberta per a agents de programari d'IA i què significa per a l'automatització de les finances
Beancount
Beancount ledger format, tooling, and ecosystem research
- Pot el vostre agent equilibrar aquests llibres?
- FinRAGBench-V: RAG multimodal amb citacions visuals en l'àmbit financer
- Poden els agents LLM ser CFO? La simulació de 132 mesos d'EnterpriseArena revela una gran bretxa
- WildToolBench: Per què cap LLM supera el 15% de precisió de sessió en l'ús d'eines en el món real
- JSONSchemaBench: La complexitat dels esquemes del món real trenca les garanties de sortida estructurada dels LLM
- FinMCP-Bench: Benchmarking d'agents LLM per a l'ús d'eines financeres del món real sota MCP
- FinTrace: Avaluació a nivell de trajectòria de la crida d'eines de LLM per a tasques financeres
- FinToolBench: Avaluació d'agents LLM en l'ús d'eines financeres del món real
- OmniEval: Banc de proves d'avaluació RAG omnidireccional per al domini financer
- Enquesta sobre detecció d'anomalies amb LLM (NAACL 2025): taxonomia forta, cobertura tabular absent
- Trobats al mig: el calibratge del biaix d'atenció posicional millora el RAG de context llarg
- Transferència basada en la incertesa per a agents LLM: quan escalar de models petits a grans
Automation
Automation techniques and tools for financial data processing workflows
- Poden els agents LLM ser CFO? La simulació de 132 mesos d'EnterpriseArena revela una gran bretxa
- WildToolBench: Per què cap LLM supera el 15% de precisió de sessió en l'ús d'eines en el món real
- JSONSchemaBench: La complexitat dels esquemes del món real trenca les garanties de sortida estructurada dels LLM
- FinMCP-Bench: Benchmarking d'agents LLM per a l'ús d'eines financeres del món real sota MCP
- FinTrace: Avaluació a nivell de trajectòria de la crida d'eines de LLM per a tasques financeres
- FinToolBench: Avaluació d'agents LLM en l'ús d'eines financeres del món real
- OmniEval: Banc de proves d'avaluació RAG omnidireccional per al domini financer
- Trobats al mig: el calibratge del biaix d'atenció posicional millora el RAG de context llarg
- Transferència basada en la incertesa per a agents LLM: quan escalar de models petits a grans
- OpenHands: Plataforma oberta per a agents de programari d'IA i què significa per a l'automatització de les finances
- TableMaster: Raonament adaptatiu per a la comprensió de taules amb LLM
- Detecció d'anomalies Zero-Shot amb LLMs: Com es comporta GPT-4 amb dades tabulars
Data Science
Data science methods applied to financial datasets and accounting workflows
- FinRAGBench-V: RAG multimodal amb citacions visuals en l'àmbit financer
- WildToolBench: Per què cap LLM supera el 15% de precisió de sessió en l'ús d'eines en el món real
- Confiança i calibratge en LLM: una enquesta sobre el que realment mostra la recerca
- FinToolBench: Avaluació d'agents LLM en l'ús d'eines financeres del món real
- OmniEval: Banc de proves d'avaluació RAG omnidireccional per al domini financer
- Enquesta sobre detecció d'anomalies amb LLM (NAACL 2025): taxonomia forta, cobertura tabular absent
- Trobats al mig: el calibratge del biaix d'atenció posicional millora el RAG de context llarg
- Fin-RATE: Com els LLM fallen en l'anàlisi financera entre períodes i entre entitats
- FinDER: Les consultes d'analistes reals exposen una bretxa de recuperació del 74% en el RAG financer
- Perduts pel mig: el biaix de posició en els LLM i el seu impacte en la IA financera
- Benchmark AD-LLM: GPT-4o assoleix un AUROC de 0,93+ en detecció d'anomalies de text zero-shot
- CausalTAD: Ordenació Causal de Columnes per a la Detecció d'Anomalies Tabulars amb LLM
Finance
Financial research, analysis, and domain knowledge for accounting AI
- FinRAGBench-V: RAG multimodal amb citacions visuals en l'àmbit financer
- Confiança i calibratge en LLM: una enquesta sobre el que realment mostra la recerca
- FinTrace: Avaluació a nivell de trajectòria de la crida d'eines de LLM per a tasques financeres
- OmniEval: Banc de proves d'avaluació RAG omnidireccional per al domini financer
- FinDER: Les consultes d'analistes reals exposen una bretxa de recuperació del 74% en el RAG financer
- Perduts pel mig: el biaix de posició en els LLM i el seu impacte en la IA financera
- AnoLLM: Ajust finit d'LLMs per a la detecció d'anomalies tabulars en dades financeres
- DocFinQA: Raonament financer de context llarg sobre presentacions completes de la SEC
- TheAgentCompany: Avaluació comparativa d'agents LLM en tasques empresarials del món real
- InvestorBench: Qwen2.5-72B supera les accions amb un 46,15% de CR
- Agent únic: iguala MAS en raonament multi-salt amb tokens iguals
- M3MAD-Bench: Són realment eficaços els debats multiagent en diferents dominis i modalitats?
Plain-Text Accounting
Research grounded in plain-text accounting formats and workflows
- Pot el vostre agent equilibrar aquests llibres?
- Transferència basada en la incertesa per a agents LLM: quan escalar de models petits a grans
- OpenHands: Plataforma oberta per a agents de programari d'IA i què significa per a l'automatització de les finances
- Els LLM obtenen un 2,3% en la generació de DSL de Beancount: El benchmark LLMFinLiteracy
- TableMaster: Raonament adaptatiu per a la comprensió de taules amb LLM
- τ²-bench: Mesurant el cost del control dual en agents d'IA conversacional
- Rendiment GAIA: Mesurant què poden fer realment els agents d'IA de frontera
- WorkArena: Com es comporten els agents web d'LLM en treballs de coneixement empresarial reals
- τ-bench: Mesurant la fiabilitat dels agents d'IA en dominis d'ús d'eines del món real
- Chain-of-Table: Evolving Tables in the LLM Reasoning Chain
- TableLlama: Pot un model obert de 7B igualar GPT-4 en la comprensió de taules?
- TAPAS: Weakly Supervised Table QA Without SQL, and What It Means for Beancount
Com abordem la recerca
Text pla primer
Partim de llibres comptables en text pla perquè les dades d’entrada siguin llegibles, portables i obertes a inspecció.
Reproduïble per defecte
Explicitem les dades d’entrada, els mètodes i les limitacions perquè altres persones puguin examinar el treball i ampliar-lo.
Troballes obertes
Publiquem les notes de recerca obertament i convidem la comunitat a qüestionar, ampliar i millorar les conclusions.
Segueix la recerca
Llegeix les notes publicades i segueix les properes preguntes al diari de recerca.