Bean Labs
De grenzen van autonome financiële intelligentie onderzoeken.
Een onderzoeksinitiatief van Beancount.io
Bean Labs publiceert open onderzoeksnotities over autonome boekhouding — taalmodellen die redeneren over dubbelboekhoudingen, controleerbare audit trails produceren en gegrond blijven in plain-text accounting.
Recente onderzoeksnotities
Open experimenten en bevindingen van Bean Labs — het Finance AI Agent-onderzoeksinitiatief van Beancount.io.
Onderzoek per onderwerp
Blader door het onderzoekslogboek via de thema's waar we het vaakst naar terugkeren.
LLM
Large language model research with applications in financial tasks
- Kan jouw agent deze boeken sluitend krijgen?
- FinRAGBench-V: Multimodale RAG met visuele citaten in het financiële domein
- Kunnen LLM-agents CFO's zijn? EnterpriseArena's 132-maanden simulatie onthult een grote kloof
- WildToolBench: Waarom geen enkele LLM meer dan 15% sessienauwkeurigheid behaalt bij toolgebruik in de praktijk
- LLM-betrouwbaarheid en -kalibratie: Een overzicht van wat het onderzoek daadwerkelijk aantoont
- JSONSchemaBench: Complexiteit van real-world schema's doorbreekt garanties voor gestructureerde LLM-output
- FinMCP-Bench: Benchmarking van LLM-agenten voor financieel toolgebruik in de praktijk onder MCP
- FinTrace: Evaluatie op trajectniveau van LLM tool-aanroepen voor financiële taken
- FinToolBench: LLM-agenten evalueren op realistisch financieel toolgebruik
- OmniEval: Omnidirectionele RAG-evaluatiebenchmark voor de financiële sector
- LLM Anomaly Detection Survey (NAACL 2025): Sterke Taxonomie, Ontbrekende Tabeldekking
- Gevonden in het midden: Kalibreren van positionele aandachts-bias verbetert RAG met lange context
AI
Artificial intelligence research and applications in finance and accounting
- FinRAGBench-V: Multimodale RAG met visuele citaten in het financiële domein
- Kunnen LLM-agents CFO's zijn? EnterpriseArena's 132-maanden simulatie onthult een grote kloof
- WildToolBench: Waarom geen enkele LLM meer dan 15% sessienauwkeurigheid behaalt bij toolgebruik in de praktijk
- LLM-betrouwbaarheid en -kalibratie: Een overzicht van wat het onderzoek daadwerkelijk aantoont
- JSONSchemaBench: Complexiteit van real-world schema's doorbreekt garanties voor gestructureerde LLM-output
- FinMCP-Bench: Benchmarking van LLM-agenten voor financieel toolgebruik in de praktijk onder MCP
- FinTrace: Evaluatie op trajectniveau van LLM tool-aanroepen voor financiële taken
- FinToolBench: LLM-agenten evalueren op realistisch financieel toolgebruik
- OmniEval: Omnidirectionele RAG-evaluatiebenchmark voor de financiële sector
- LLM Anomaly Detection Survey (NAACL 2025): Sterke Taxonomie, Ontbrekende Tabeldekking
- Gevonden in het midden: Kalibreren van positionele aandachts-bias verbetert RAG met lange context
- Onzekerheidsbewuste Deferral voor LLM-agenten: Wanneer te escaleren van kleine naar grote modellen
Machine Learning
Machine learning techniques for financial data analysis and automation
- FinRAGBench-V: Multimodale RAG met visuele citaten in het financiële domein
- WildToolBench: Waarom geen enkele LLM meer dan 15% sessienauwkeurigheid behaalt bij toolgebruik in de praktijk
- LLM-betrouwbaarheid en -kalibratie: Een overzicht van wat het onderzoek daadwerkelijk aantoont
- JSONSchemaBench: Complexiteit van real-world schema's doorbreekt garanties voor gestructureerde LLM-output
- FinMCP-Bench: Benchmarking van LLM-agenten voor financieel toolgebruik in de praktijk onder MCP
- FinTrace: Evaluatie op trajectniveau van LLM tool-aanroepen voor financiële taken
- FinToolBench: LLM-agenten evalueren op realistisch financieel toolgebruik
- OmniEval: Omnidirectionele RAG-evaluatiebenchmark voor de financiële sector
- LLM Anomaly Detection Survey (NAACL 2025): Sterke Taxonomie, Ontbrekende Tabeldekking
- Gevonden in het midden: Kalibreren van positionele aandachts-bias verbetert RAG met lange context
- Onzekerheidsbewuste Deferral voor LLM-agenten: Wanneer te escaleren van kleine naar grote modellen
- OpenHands: Open Platform voor AI Software Agents en wat het betekent voor Financiële Automatisering
Beancount
Beancount ledger format, tooling, and ecosystem research
- Kan jouw agent deze boeken sluitend krijgen?
- FinRAGBench-V: Multimodale RAG met visuele citaten in het financiële domein
- Kunnen LLM-agents CFO's zijn? EnterpriseArena's 132-maanden simulatie onthult een grote kloof
- WildToolBench: Waarom geen enkele LLM meer dan 15% sessienauwkeurigheid behaalt bij toolgebruik in de praktijk
- JSONSchemaBench: Complexiteit van real-world schema's doorbreekt garanties voor gestructureerde LLM-output
- FinMCP-Bench: Benchmarking van LLM-agenten voor financieel toolgebruik in de praktijk onder MCP
- FinTrace: Evaluatie op trajectniveau van LLM tool-aanroepen voor financiële taken
- FinToolBench: LLM-agenten evalueren op realistisch financieel toolgebruik
- OmniEval: Omnidirectionele RAG-evaluatiebenchmark voor de financiële sector
- LLM Anomaly Detection Survey (NAACL 2025): Sterke Taxonomie, Ontbrekende Tabeldekking
- Gevonden in het midden: Kalibreren van positionele aandachts-bias verbetert RAG met lange context
- Onzekerheidsbewuste Deferral voor LLM-agenten: Wanneer te escaleren van kleine naar grote modellen
Automation
Automation techniques and tools for financial data processing workflows
- Kunnen LLM-agents CFO's zijn? EnterpriseArena's 132-maanden simulatie onthult een grote kloof
- WildToolBench: Waarom geen enkele LLM meer dan 15% sessienauwkeurigheid behaalt bij toolgebruik in de praktijk
- JSONSchemaBench: Complexiteit van real-world schema's doorbreekt garanties voor gestructureerde LLM-output
- FinMCP-Bench: Benchmarking van LLM-agenten voor financieel toolgebruik in de praktijk onder MCP
- FinTrace: Evaluatie op trajectniveau van LLM tool-aanroepen voor financiële taken
- FinToolBench: LLM-agenten evalueren op realistisch financieel toolgebruik
- OmniEval: Omnidirectionele RAG-evaluatiebenchmark voor de financiële sector
- Gevonden in het midden: Kalibreren van positionele aandachts-bias verbetert RAG met lange context
- Onzekerheidsbewuste Deferral voor LLM-agenten: Wanneer te escaleren van kleine naar grote modellen
- OpenHands: Open Platform voor AI Software Agents en wat het betekent voor Financiële Automatisering
- TableMaster: Adaptief redeneren voor tabelbegrip met LLM's
- Zero-Shot Anomalie-Detectie met LLM's: Hoe GPT-4 Presteert op Tabulaire Data
Data Science
Data science methods applied to financial datasets and accounting workflows
- FinRAGBench-V: Multimodale RAG met visuele citaten in het financiële domein
- WildToolBench: Waarom geen enkele LLM meer dan 15% sessienauwkeurigheid behaalt bij toolgebruik in de praktijk
- LLM-betrouwbaarheid en -kalibratie: Een overzicht van wat het onderzoek daadwerkelijk aantoont
- FinToolBench: LLM-agenten evalueren op realistisch financieel toolgebruik
- OmniEval: Omnidirectionele RAG-evaluatiebenchmark voor de financiële sector
- LLM Anomaly Detection Survey (NAACL 2025): Sterke Taxonomie, Ontbrekende Tabeldekking
- Gevonden in het midden: Kalibreren van positionele aandachts-bias verbetert RAG met lange context
- Fin-RATE: Hoe LLM's falen bij financiële analyse over verschillende perioden en entiteiten
- FinDER: Echte vragen van analisten onthullen een recall-kloof van 74% in financiële RAG
- Lost in the Middle: Positiebias in LLM's en de impact op Finance AI
- AD-LLM Benchmark: GPT-4o behaalt 0,93+ AUROC Zero-Shot voor tekstuele anomaliedetectie
- CausalTAD: Causale Kolomvolgorde voor LLM Tabulaire Anomaliedetectie
Finance
Financial research, analysis, and domain knowledge for accounting AI
- FinRAGBench-V: Multimodale RAG met visuele citaten in het financiële domein
- LLM-betrouwbaarheid en -kalibratie: Een overzicht van wat het onderzoek daadwerkelijk aantoont
- FinTrace: Evaluatie op trajectniveau van LLM tool-aanroepen voor financiële taken
- OmniEval: Omnidirectionele RAG-evaluatiebenchmark voor de financiële sector
- FinDER: Echte vragen van analisten onthullen een recall-kloof van 74% in financiële RAG
- Lost in the Middle: Positiebias in LLM's en de impact op Finance AI
- AnoLLM: LLM's finetunen voor tabelgebaseerde anomaliedetectie in financiële gegevens
- DocFinQA: Financieel redeneren met lange context op volledige SEC-documenten
- TheAgentCompany: Benchmarking van LLM-agents voor realistische bedrijfstaken
- InvestorBench: Qwen2.5-72B presteert het beste op aandelen met 46,15% CR
- Single-Agent: even goed als MAS bij multi-hop met gelijke tokens
- M3MAD-Bench: Zijn debatten tussen meerdere agenten echt effectief over verschillende domeinen en modaliteiten?
Plain-Text Accounting
Research grounded in plain-text accounting formats and workflows
- Kan jouw agent deze boeken sluitend krijgen?
- Onzekerheidsbewuste Deferral voor LLM-agenten: Wanneer te escaleren van kleine naar grote modellen
- OpenHands: Open Platform voor AI Software Agents en wat het betekent voor Financiële Automatisering
- LLM's scoren 2,3% op Beancount DSL-generatie: De LLMFinLiteracy-benchmark
- TableMaster: Adaptief redeneren voor tabelbegrip met LLM's
- τ²-bench: De kosten meten van dual-control in conversationele AI-agents
- GAIA-benchmark: Meten wat grensverleggende AI-agenten echt kunnen
- WorkArena: Hoe LLM-webagents presteren op echt zakelijk kenniswerk
- τ-bench: De betrouwbaarheid van AI-agents meten in praktijkgerichte toolgebruik-domeinen
- Chain-of-Table: Evoluerende Tabellen in de LLM-Redeneerketen
- TableLlama: Kan een open 7B-model GPT-4 evenaren in tabelbegrip?
- TAPAS: Zwak gesuperviseerde tabel-QA zonder SQL, en wat dit betekent voor Beancount
Onze onderzoeksaanpak
Platte tekst eerst
We beginnen met plattetekstboeken, zodat de invoer leesbaar, overdraagbaar en controleerbaar blijft.
Standaard reproduceerbaar
We maken invoer, methoden en beperkingen expliciet, zodat anderen het werk kunnen onderzoeken en erop kunnen voortbouwen.
Open bevindingen
We publiceren onderzoeksnotities openlijk en nodigen de gemeenschap uit om bevindingen te bevragen, uit te breiden en te verbeteren.
Volg het onderzoek
Lees de gepubliceerde notities en volg de volgende vragen in het onderzoekslogboek.