Bean Labs
Skúmanie hraníc autonómnej finančnej inteligencie.
Výskumná iniciatíva Beancount.io
Bean Labs publikuje otvorené výskumné poznámky o autonómnom účtovníctve — jazykové modely, ktoré uvažujú nad podvojným účtovníctvom, vytvárajú overiteľné audítorské stopy a zostávajú zakotvené v účtovníctve v obyčajnom texte.
Najnovšie výskumné poznámky
Otvorené experimenty a zistenia z Bean Labs — výskumnej iniciatívy Finance AI Agent od Beancount.io.
Výskum podľa témy
Prehľadávajte výskumný denník podľa tém, ku ktorým sa najčastejšie vraciame.
LLM
Large language model research with applications in financial tasks
- Dokáže váš agent vyrovnať tieto knihy?
- FinRAGBench-V: Multimodálny RAG s vizuálnymi citáciami vo finančnej oblasti
- Môžu byť LLM agenti finančnými riaditeľmi? 132-mesačná simulácia EnterpriseArena odhaľuje veľkú priepasť
- WildToolBench: Prečo žiadne LLM neprekračuje 15 % presnosť relácie pri používaní nástrojov v reálnom svete
- Istota a kalibrácia LLM: Prehľad toho, čo výskum v skutočnosti ukazuje
- JSONSchemaBench: Komplexita schém v reálnom svete narúša garancie štruktúrovaného výstupu LLM
- FinMCP-Bench: Benchmarking agentov LLM pre používanie finančných nástrojov v reálnom svete pod protokolom MCP
- FinTrace: Hodnotenie volania nástrojov LLM pre finančné úlohy na úrovni trajektórie
- FinToolBench: Hodnotenie LLM agentov na reálnych finančných nástrojoch
- OmniEval: Všesmerový benchmark pre hodnotenie RAG vo finančnej oblasti
- Prehľad detekcie anomálií pomocou LLM (NAACL 2025): Silná taxonómia, chýbajúce pokrytie tabuľkových dát
- Nájdené v strede: Kalibrácia predpojatosti pozičnej pozornosti zlepšuje RAG s dlhým kontextom
AI
Artificial intelligence research and applications in finance and accounting
- FinRAGBench-V: Multimodálny RAG s vizuálnymi citáciami vo finančnej oblasti
- Môžu byť LLM agenti finančnými riaditeľmi? 132-mesačná simulácia EnterpriseArena odhaľuje veľkú priepasť
- WildToolBench: Prečo žiadne LLM neprekračuje 15 % presnosť relácie pri používaní nástrojov v reálnom svete
- Istota a kalibrácia LLM: Prehľad toho, čo výskum v skutočnosti ukazuje
- JSONSchemaBench: Komplexita schém v reálnom svete narúša garancie štruktúrovaného výstupu LLM
- FinMCP-Bench: Benchmarking agentov LLM pre používanie finančných nástrojov v reálnom svete pod protokolom MCP
- FinTrace: Hodnotenie volania nástrojov LLM pre finančné úlohy na úrovni trajektórie
- FinToolBench: Hodnotenie LLM agentov na reálnych finančných nástrojoch
- OmniEval: Všesmerový benchmark pre hodnotenie RAG vo finančnej oblasti
- Prehľad detekcie anomálií pomocou LLM (NAACL 2025): Silná taxonómia, chýbajúce pokrytie tabuľkových dát
- Nájdené v strede: Kalibrácia predpojatosti pozičnej pozornosti zlepšuje RAG s dlhým kontextom
- Odkladanie s vedomím neistoty pre agentov LLM: Kedy prejsť z malých na veľké modely
Machine Learning
Machine learning techniques for financial data analysis and automation
- FinRAGBench-V: Multimodálny RAG s vizuálnymi citáciami vo finančnej oblasti
- WildToolBench: Prečo žiadne LLM neprekračuje 15 % presnosť relácie pri používaní nástrojov v reálnom svete
- Istota a kalibrácia LLM: Prehľad toho, čo výskum v skutočnosti ukazuje
- JSONSchemaBench: Komplexita schém v reálnom svete narúša garancie štruktúrovaného výstupu LLM
- FinMCP-Bench: Benchmarking agentov LLM pre používanie finančných nástrojov v reálnom svete pod protokolom MCP
- FinTrace: Hodnotenie volania nástrojov LLM pre finančné úlohy na úrovni trajektórie
- FinToolBench: Hodnotenie LLM agentov na reálnych finančných nástrojoch
- OmniEval: Všesmerový benchmark pre hodnotenie RAG vo finančnej oblasti
- Prehľad detekcie anomálií pomocou LLM (NAACL 2025): Silná taxonómia, chýbajúce pokrytie tabuľkových dát
- Nájdené v strede: Kalibrácia predpojatosti pozičnej pozornosti zlepšuje RAG s dlhým kontextom
- Odkladanie s vedomím neistoty pre agentov LLM: Kedy prejsť z malých na veľké modely
- OpenHands: Otvorená platforma pre AI softvérových agentov a čo to znamená pre automatizáciu financií
Beancount
Beancount ledger format, tooling, and ecosystem research
- Dokáže váš agent vyrovnať tieto knihy?
- FinRAGBench-V: Multimodálny RAG s vizuálnymi citáciami vo finančnej oblasti
- Môžu byť LLM agenti finančnými riaditeľmi? 132-mesačná simulácia EnterpriseArena odhaľuje veľkú priepasť
- WildToolBench: Prečo žiadne LLM neprekračuje 15 % presnosť relácie pri používaní nástrojov v reálnom svete
- JSONSchemaBench: Komplexita schém v reálnom svete narúša garancie štruktúrovaného výstupu LLM
- FinMCP-Bench: Benchmarking agentov LLM pre používanie finančných nástrojov v reálnom svete pod protokolom MCP
- FinTrace: Hodnotenie volania nástrojov LLM pre finančné úlohy na úrovni trajektórie
- FinToolBench: Hodnotenie LLM agentov na reálnych finančných nástrojoch
- OmniEval: Všesmerový benchmark pre hodnotenie RAG vo finančnej oblasti
- Prehľad detekcie anomálií pomocou LLM (NAACL 2025): Silná taxonómia, chýbajúce pokrytie tabuľkových dát
- Nájdené v strede: Kalibrácia predpojatosti pozičnej pozornosti zlepšuje RAG s dlhým kontextom
- Odkladanie s vedomím neistoty pre agentov LLM: Kedy prejsť z malých na veľké modely
Automation
Automation techniques and tools for financial data processing workflows
- Môžu byť LLM agenti finančnými riaditeľmi? 132-mesačná simulácia EnterpriseArena odhaľuje veľkú priepasť
- WildToolBench: Prečo žiadne LLM neprekračuje 15 % presnosť relácie pri používaní nástrojov v reálnom svete
- JSONSchemaBench: Komplexita schém v reálnom svete narúša garancie štruktúrovaného výstupu LLM
- FinMCP-Bench: Benchmarking agentov LLM pre používanie finančných nástrojov v reálnom svete pod protokolom MCP
- FinTrace: Hodnotenie volania nástrojov LLM pre finančné úlohy na úrovni trajektórie
- FinToolBench: Hodnotenie LLM agentov na reálnych finančných nástrojoch
- OmniEval: Všesmerový benchmark pre hodnotenie RAG vo finančnej oblasti
- Nájdené v strede: Kalibrácia predpojatosti pozičnej pozornosti zlepšuje RAG s dlhým kontextom
- Odkladanie s vedomím neistoty pre agentov LLM: Kedy prejsť z malých na veľké modely
- OpenHands: Otvorená platforma pre AI softvérových agentov a čo to znamená pre automatizáciu financií
- TableMaster: Adaptívne uvažovanie pre porozumenie tabuľkám pomocou LLM
- Detekcia anomálií s nulovým učením pomocou LLM: Ako GPT-4 funguje pri tabuľkových dátach
Data Science
Data science methods applied to financial datasets and accounting workflows
- FinRAGBench-V: Multimodálny RAG s vizuálnymi citáciami vo finančnej oblasti
- WildToolBench: Prečo žiadne LLM neprekračuje 15 % presnosť relácie pri používaní nástrojov v reálnom svete
- Istota a kalibrácia LLM: Prehľad toho, čo výskum v skutočnosti ukazuje
- FinToolBench: Hodnotenie LLM agentov na reálnych finančných nástrojoch
- OmniEval: Všesmerový benchmark pre hodnotenie RAG vo finančnej oblasti
- Prehľad detekcie anomálií pomocou LLM (NAACL 2025): Silná taxonómia, chýbajúce pokrytie tabuľkových dát
- Nájdené v strede: Kalibrácia predpojatosti pozičnej pozornosti zlepšuje RAG s dlhým kontextom
- Fin-RATE: Ako LLM zlyhávajú pri finančnej analýze medzi obdobiami a entitami
- FinDER: Skutočné dopyty analytikov odhaľujú 74 % medzeru v návratnosti pri finančnom RAG
- Stratení v strede: Pozičná zaujatosť v LLM a jej vplyv na finančnú AI
- Benchmark AD-LLM: GPT-4o dosahuje 0,93+ AUROC Zero-Shot pri detekcii textových anomálií
- CausalTAD: Kauzálne usporiadanie stĺpcov pre detekciu anomálií v tabuľkových dátach pomocou LLM
Finance
Financial research, analysis, and domain knowledge for accounting AI
- FinRAGBench-V: Multimodálny RAG s vizuálnymi citáciami vo finančnej oblasti
- Istota a kalibrácia LLM: Prehľad toho, čo výskum v skutočnosti ukazuje
- FinTrace: Hodnotenie volania nástrojov LLM pre finančné úlohy na úrovni trajektórie
- OmniEval: Všesmerový benchmark pre hodnotenie RAG vo finančnej oblasti
- FinDER: Skutočné dopyty analytikov odhaľujú 74 % medzeru v návratnosti pri finančnom RAG
- Stratení v strede: Pozičná zaujatosť v LLM a jej vplyv na finančnú AI
- AnoLLM: Doladenie LLM pre detekciu anomálií v tabuľkových finančných údajoch
- DocFinQA: Dlho-kontextové finančné uvažovanie na úplných podaniach SEC
- TheAgentCompany: Benchmarking agentov LLM na podnikových úlohách z reálneho sveta
- InvestorBench: Qwen2.5-72B vedie akcie s 46,15% CR
- Single-Agent: rovná sa MAS na viacstupňových úlohách pri rovnakých tokenoch
- M3MAD-Bench: Sú debaty viacerých agentov skutočne efektívne naprieč doménami a modalitami?
Plain-Text Accounting
Research grounded in plain-text accounting formats and workflows
- Dokáže váš agent vyrovnať tieto knihy?
- Odkladanie s vedomím neistoty pre agentov LLM: Kedy prejsť z malých na veľké modely
- OpenHands: Otvorená platforma pre AI softvérových agentov a čo to znamená pre automatizáciu financií
- LLM dosahujú 2,3 % v generovaní Beancount DSL: Benchmark LLMFinLiteracy
- TableMaster: Adaptívne uvažovanie pre porozumenie tabuľkám pomocou LLM
- τ²-bench: Meranie nákladov na duálne riadenie v konverzačných AI agentoch
- GAIA Benchmark: Meranie toho, čo hraničné AI agenty skutočne dokážu
- WorkArena: Ako si weboví agenti LLM poradia so skutočnou podnikovou znalostnou prácou
- τ-bench: Meranie spoľahlivosti AI agentov v reálnych doménach s použitím nástrojov
- Chain-of-Table: Evolving Tables in the LLM Reasoning Chain
- TableLlama: Dokáže otvorený model so 7B parametrami konkurovať GPT-4 v porozumení tabuliek?
- TAPAS: Slabo dohliadané tabuľkové QA bez SQL a čo to znamená pre Beancount
Náš prístup k výskumu
Obyčajný text na prvom mieste
Začíname s účtovnými knihami v obyčajnom texte, aby vstupy zostali čitateľné, prenosné a otvorené kontrole.
Reprodukovateľné predvolene
Jasne opisujeme vstupy, metódy a obmedzenia, aby ostatní mohli prácu preskúmať a nadviazať na ňu.
Otvorené zistenia
Otvorene zverejňujeme výskumné poznámky a pozývame komunitu, aby závery spochybňovala, rozširovala a zlepšovala.
Sledujte výskum
Prečítajte si zverejnené poznámky a sledujte ďalšie otázky vo výskumnom denníku.