Bean Labs
Die Grenzen autonomer Finanzintelligenz erforschen.
Eine Forschungsinitiative von Beancount.io
Bean Labs veröffentlicht offene Forschungsnotizen zur autonomen Buchhaltung — Sprachmodelle, die über doppelte Buchführung nachdenken, überprüfbare Prüfpfade erzeugen und in der Klartext-Buchhaltung verankert bleiben.
Aktuelle Forschungsnotizen
Offene Experimente und Erkenntnisse von Bean Labs — die Finance-AI-Agent-Forschungsinitiative von Beancount.io.
Forschung nach Thema
Durchsuchen Sie das Forschungslog nach den Themen, zu denen wir am häufigsten zurückkehren.
LLM
Large language model research with applications in financial tasks
- Kann dein Agent diese Bücher ausgleichen?
- FinRAGBench-V: Multimodales RAG mit visuellen Zitaten im Finanzbereich
- Können LLM-Agenten CFOs sein? EnterpriseArenas 132-monatige Simulation deckt eine große Lücke auf
- WildToolBench: Warum kein LLM eine Sitzungsgenauigkeit von 15 % bei der realen Tool-Nutzung überschreitet
- LLM-Konfidenz und Kalibrierung: Ein Überblick über den tatsächlichen Stand der Forschung
- JSONSchemaBench: Reale Schema-Komplexität bricht Garantien für strukturierten LLM-Output
- FinMCP-Bench: Benchmarking von LLM-Agenten für den realen Einsatz von Finanz-Tools unter MCP
- FinTrace: Evaluation von LLM-Tool-Aufrufen für Finanzaufgaben auf Trajektorie-Ebene
- FinToolBench: Bewertung von LLM-Agenten bei der realen Nutzung von Finanztools
- OmniEval: Omnidirektionaler RAG-Evaluations-Benchmark für den Finanzsektor
- LLM-Anomalieerkennung Survey (NAACL 2025): Starke Taxonomie, fehlende Abdeckung tabellarischer Daten
- In der Mitte gefunden: Die Kalibrierung des positionalen Attention-Bias verbessert Long-Context RAG
AI
Artificial intelligence research and applications in finance and accounting
- FinRAGBench-V: Multimodales RAG mit visuellen Zitaten im Finanzbereich
- Können LLM-Agenten CFOs sein? EnterpriseArenas 132-monatige Simulation deckt eine große Lücke auf
- WildToolBench: Warum kein LLM eine Sitzungsgenauigkeit von 15 % bei der realen Tool-Nutzung überschreitet
- LLM-Konfidenz und Kalibrierung: Ein Überblick über den tatsächlichen Stand der Forschung
- JSONSchemaBench: Reale Schema-Komplexität bricht Garantien für strukturierten LLM-Output
- FinMCP-Bench: Benchmarking von LLM-Agenten für den realen Einsatz von Finanz-Tools unter MCP
- FinTrace: Evaluation von LLM-Tool-Aufrufen für Finanzaufgaben auf Trajektorie-Ebene
- FinToolBench: Bewertung von LLM-Agenten bei der realen Nutzung von Finanztools
- OmniEval: Omnidirektionaler RAG-Evaluations-Benchmark für den Finanzsektor
- LLM-Anomalieerkennung Survey (NAACL 2025): Starke Taxonomie, fehlende Abdeckung tabellarischer Daten
- In der Mitte gefunden: Die Kalibrierung des positionalen Attention-Bias verbessert Long-Context RAG
- Unsicherheitsbewusste Weiterleitung für LLM-Agenten: Wann von kleinen zu großen Modellen eskaliert werden sollte
Machine Learning
Machine learning techniques for financial data analysis and automation
- FinRAGBench-V: Multimodales RAG mit visuellen Zitaten im Finanzbereich
- WildToolBench: Warum kein LLM eine Sitzungsgenauigkeit von 15 % bei der realen Tool-Nutzung überschreitet
- LLM-Konfidenz und Kalibrierung: Ein Überblick über den tatsächlichen Stand der Forschung
- JSONSchemaBench: Reale Schema-Komplexität bricht Garantien für strukturierten LLM-Output
- FinMCP-Bench: Benchmarking von LLM-Agenten für den realen Einsatz von Finanz-Tools unter MCP
- FinTrace: Evaluation von LLM-Tool-Aufrufen für Finanzaufgaben auf Trajektorie-Ebene
- FinToolBench: Bewertung von LLM-Agenten bei der realen Nutzung von Finanztools
- OmniEval: Omnidirektionaler RAG-Evaluations-Benchmark für den Finanzsektor
- LLM-Anomalieerkennung Survey (NAACL 2025): Starke Taxonomie, fehlende Abdeckung tabellarischer Daten
- In der Mitte gefunden: Die Kalibrierung des positionalen Attention-Bias verbessert Long-Context RAG
- Unsicherheitsbewusste Weiterleitung für LLM-Agenten: Wann von kleinen zu großen Modellen eskaliert werden sollte
- OpenHands: Offene Plattform für KI-Softwareagenten und was sie für die Finanzautomatisierung bedeutet
Beancount
Beancount ledger format, tooling, and ecosystem research
- Kann dein Agent diese Bücher ausgleichen?
- FinRAGBench-V: Multimodales RAG mit visuellen Zitaten im Finanzbereich
- Können LLM-Agenten CFOs sein? EnterpriseArenas 132-monatige Simulation deckt eine große Lücke auf
- WildToolBench: Warum kein LLM eine Sitzungsgenauigkeit von 15 % bei der realen Tool-Nutzung überschreitet
- JSONSchemaBench: Reale Schema-Komplexität bricht Garantien für strukturierten LLM-Output
- FinMCP-Bench: Benchmarking von LLM-Agenten für den realen Einsatz von Finanz-Tools unter MCP
- FinTrace: Evaluation von LLM-Tool-Aufrufen für Finanzaufgaben auf Trajektorie-Ebene
- FinToolBench: Bewertung von LLM-Agenten bei der realen Nutzung von Finanztools
- OmniEval: Omnidirektionaler RAG-Evaluations-Benchmark für den Finanzsektor
- LLM-Anomalieerkennung Survey (NAACL 2025): Starke Taxonomie, fehlende Abdeckung tabellarischer Daten
- In der Mitte gefunden: Die Kalibrierung des positionalen Attention-Bias verbessert Long-Context RAG
- Unsicherheitsbewusste Weiterleitung für LLM-Agenten: Wann von kleinen zu großen Modellen eskaliert werden sollte
Automation
Automation techniques and tools for financial data processing workflows
- Können LLM-Agenten CFOs sein? EnterpriseArenas 132-monatige Simulation deckt eine große Lücke auf
- WildToolBench: Warum kein LLM eine Sitzungsgenauigkeit von 15 % bei der realen Tool-Nutzung überschreitet
- JSONSchemaBench: Reale Schema-Komplexität bricht Garantien für strukturierten LLM-Output
- FinMCP-Bench: Benchmarking von LLM-Agenten für den realen Einsatz von Finanz-Tools unter MCP
- FinTrace: Evaluation von LLM-Tool-Aufrufen für Finanzaufgaben auf Trajektorie-Ebene
- FinToolBench: Bewertung von LLM-Agenten bei der realen Nutzung von Finanztools
- OmniEval: Omnidirektionaler RAG-Evaluations-Benchmark für den Finanzsektor
- In der Mitte gefunden: Die Kalibrierung des positionalen Attention-Bias verbessert Long-Context RAG
- Unsicherheitsbewusste Weiterleitung für LLM-Agenten: Wann von kleinen zu großen Modellen eskaliert werden sollte
- OpenHands: Offene Plattform für KI-Softwareagenten und was sie für die Finanzautomatisierung bedeutet
- TableMaster: Adaptives Denken für das Tabellenverständnis mit LLMs
- Zero-Shot-Anomalieerkennung mit LLMs: Wie GPT-4 bei tabellarischen Daten abschneidet
Data Science
Data science methods applied to financial datasets and accounting workflows
- FinRAGBench-V: Multimodales RAG mit visuellen Zitaten im Finanzbereich
- WildToolBench: Warum kein LLM eine Sitzungsgenauigkeit von 15 % bei der realen Tool-Nutzung überschreitet
- LLM-Konfidenz und Kalibrierung: Ein Überblick über den tatsächlichen Stand der Forschung
- FinToolBench: Bewertung von LLM-Agenten bei der realen Nutzung von Finanztools
- OmniEval: Omnidirektionaler RAG-Evaluations-Benchmark für den Finanzsektor
- LLM-Anomalieerkennung Survey (NAACL 2025): Starke Taxonomie, fehlende Abdeckung tabellarischer Daten
- In der Mitte gefunden: Die Kalibrierung des positionalen Attention-Bias verbessert Long-Context RAG
- Fin-RATE: Wie LLMs bei periodenübergreifenden und unternehmensübergreifenden Finanzanalysen scheitern
- FinDER: Reale Analystenanfragen decken eine Recall-Lücke von 74 % bei Finanz-RAG auf
- Lost in the Middle: Position Bias in LLMs und seine Auswirkungen auf Finance AI
- AD-LLM-Benchmark: GPT-4o erreicht 0,93+ AUROC Zero-Shot bei der Text-Anomalieerkennung
- CausalTAD: Kausale Spaltenordnung für die Tabellen-Anomalieerkennung mit LLMs
Finance
Financial research, analysis, and domain knowledge for accounting AI
- FinRAGBench-V: Multimodales RAG mit visuellen Zitaten im Finanzbereich
- LLM-Konfidenz und Kalibrierung: Ein Überblick über den tatsächlichen Stand der Forschung
- FinTrace: Evaluation von LLM-Tool-Aufrufen für Finanzaufgaben auf Trajektorie-Ebene
- OmniEval: Omnidirektionaler RAG-Evaluations-Benchmark für den Finanzsektor
- FinDER: Reale Analystenanfragen decken eine Recall-Lücke von 74 % bei Finanz-RAG auf
- Lost in the Middle: Position Bias in LLMs und seine Auswirkungen auf Finance AI
- AnoLLM: Fine-Tuning von LLMs zur tabellarischen Anomalieerkennung in Finanzdaten
- DocFinQA: Langkontextuelles finanzielles Schlussfolgern auf vollständigen SEC-Filings
- TheAgentCompany: Benchmarking von LLM-Agenten bei realen Unternehmensaufgaben
- InvestorBench: Qwen2.5-72B führt bei Aktien mit 46,15% CR
- Single-Agent: entspricht MAS bei Multi-Hop bei gleichen Tokens
- M3MAD-Bench: Sind Multi-Agenten-Debatten über Domänen und Modalitäten hinweg wirklich effektiv?
Plain-Text Accounting
Research grounded in plain-text accounting formats and workflows
- Kann dein Agent diese Bücher ausgleichen?
- Unsicherheitsbewusste Weiterleitung für LLM-Agenten: Wann von kleinen zu großen Modellen eskaliert werden sollte
- OpenHands: Offene Plattform für KI-Softwareagenten und was sie für die Finanzautomatisierung bedeutet
- LLMs erreichen 2,3 % bei der Beancount DSL-Generierung: Der LLMFinLiteracy-Benchmark
- TableMaster: Adaptives Denken für das Tabellenverständnis mit LLMs
- τ²-bench: Messung der Kosten von Dual-Control in konversationellen KI-Agenten
- GAIA Benchmark: Messen, was modernste KI-Agenten wirklich leisten können
- WorkArena: Wie LLM-Web-Agenten bei realer Wissensarbeit in Unternehmen abschneiden
- τ-bench: Messung der Zuverlässigkeit von KI-Agenten in praxisnahen Tool-Nutzungs-Domänen
- Chain-of-Table: Evolution von Tabellen in der LLM-Schlussfolgerungskette
- TableLlama: Kann ein offenes 7B-Modell mit GPT-4 beim Tabellenverständnis mithalten?
- TAPAS: Schwach überwachtes Table-QA ohne SQL und was es für Beancount bedeutet
Unser Forschungsansatz
Plain-Text zuerst
Wir beginnen mit Klartext-Büchern, damit die Eingaben lesbar, portabel und überprüfbar bleiben.
Standardmäßig reproduzierbar
Wir legen Eingaben, Methoden und Grenzen offen, damit andere die Arbeit prüfen und darauf aufbauen können.
Offene Erkenntnisse
Wir veröffentlichen Forschungsnotizen offen und laden die Community ein, die Ergebnisse zu hinterfragen, zu erweitern und zu verbessern.
Die Forschung verfolgen
Lies die veröffentlichten Notizen und verfolge die nächsten Fragen im Forschungsprotokoll.