Bean Labs
Rechercher les frontières de l'intelligence financière autonome.
Une initiative de recherche de Beancount.io
Bean Labs publie des notes de recherche ouvertes sur la tenue de livres autonome — des modèles de langage qui raisonnent sur les écritures en partie double, produisent des pistes d'audit vérifiables et restent ancrés dans la comptabilité en texte brut.
Notes de recherche récentes
Expériences et résultats ouverts de Bean Labs — l'initiative de recherche Finance AI Agent de Beancount.io.
Recherche par sujet
Parcourez le journal de recherche par les thèmes que nous abordons le plus souvent.
LLM
Large language model research with applications in financial tasks
- Votre agent peut-il équilibrer ces livres ?
- FinRAGBench-V : RAG multimodal avec citations visuelles dans le domaine financier
- Les agents LLM peuvent-ils être directeurs financiers ? La simulation sur 132 mois d'EnterpriseArena révèle un écart important
- WildToolBench : Pourquoi aucun LLM ne dépasse 15 % de précision par session dans l'utilisation d'outils en conditions réelles
- Confiance et calibration des LLM : une étude de ce que montre réellement la recherche
- JSONSchemaBench : la complexité des schémas réels brise les garanties de sortie structurée des LLM
- FinMCP-Bench : Évaluation des agents LLM pour l'utilisation d'outils financiers réels sous MCP
- FinTrace : Évaluation au niveau de la trajectoire de l'appel d'outils par les LLM pour les tâches financières
- FinToolBench : Évaluation des agents LLM sur l'utilisation réelle d'outils financiers
- OmniEval : un benchmark d'évaluation RAG omnidirectionnel pour le domaine financier
- Étude sur la détection d'anomalies par LLM (NAACL 2025) : Une taxonomie robuste, une couverture tabulaire absente
- Found in the Middle : Calibrer le biais d'attention positionnelle améliore le RAG à long contexte
AI
Artificial intelligence research and applications in finance and accounting
- FinRAGBench-V : RAG multimodal avec citations visuelles dans le domaine financier
- Les agents LLM peuvent-ils être directeurs financiers ? La simulation sur 132 mois d'EnterpriseArena révèle un écart important
- WildToolBench : Pourquoi aucun LLM ne dépasse 15 % de précision par session dans l'utilisation d'outils en conditions réelles
- Confiance et calibration des LLM : une étude de ce que montre réellement la recherche
- JSONSchemaBench : la complexité des schémas réels brise les garanties de sortie structurée des LLM
- FinMCP-Bench : Évaluation des agents LLM pour l'utilisation d'outils financiers réels sous MCP
- FinTrace : Évaluation au niveau de la trajectoire de l'appel d'outils par les LLM pour les tâches financières
- FinToolBench : Évaluation des agents LLM sur l'utilisation réelle d'outils financiers
- OmniEval : un benchmark d'évaluation RAG omnidirectionnel pour le domaine financier
- Étude sur la détection d'anomalies par LLM (NAACL 2025) : Une taxonomie robuste, une couverture tabulaire absente
- Found in the Middle : Calibrer le biais d'attention positionnelle améliore le RAG à long contexte
- Report avec détection d'incertitude pour les agents LLM : quand passer d'un petit à un grand modèle
Machine Learning
Machine learning techniques for financial data analysis and automation
- FinRAGBench-V : RAG multimodal avec citations visuelles dans le domaine financier
- WildToolBench : Pourquoi aucun LLM ne dépasse 15 % de précision par session dans l'utilisation d'outils en conditions réelles
- Confiance et calibration des LLM : une étude de ce que montre réellement la recherche
- JSONSchemaBench : la complexité des schémas réels brise les garanties de sortie structurée des LLM
- FinMCP-Bench : Évaluation des agents LLM pour l'utilisation d'outils financiers réels sous MCP
- FinTrace : Évaluation au niveau de la trajectoire de l'appel d'outils par les LLM pour les tâches financières
- FinToolBench : Évaluation des agents LLM sur l'utilisation réelle d'outils financiers
- OmniEval : un benchmark d'évaluation RAG omnidirectionnel pour le domaine financier
- Étude sur la détection d'anomalies par LLM (NAACL 2025) : Une taxonomie robuste, une couverture tabulaire absente
- Found in the Middle : Calibrer le biais d'attention positionnelle améliore le RAG à long contexte
- Report avec détection d'incertitude pour les agents LLM : quand passer d'un petit à un grand modèle
- OpenHands : une plateforme ouverte pour les agents logiciels d'IA et son impact sur l'automatisation de la finance
Beancount
Beancount ledger format, tooling, and ecosystem research
- Votre agent peut-il équilibrer ces livres ?
- FinRAGBench-V : RAG multimodal avec citations visuelles dans le domaine financier
- Les agents LLM peuvent-ils être directeurs financiers ? La simulation sur 132 mois d'EnterpriseArena révèle un écart important
- WildToolBench : Pourquoi aucun LLM ne dépasse 15 % de précision par session dans l'utilisation d'outils en conditions réelles
- JSONSchemaBench : la complexité des schémas réels brise les garanties de sortie structurée des LLM
- FinMCP-Bench : Évaluation des agents LLM pour l'utilisation d'outils financiers réels sous MCP
- FinTrace : Évaluation au niveau de la trajectoire de l'appel d'outils par les LLM pour les tâches financières
- FinToolBench : Évaluation des agents LLM sur l'utilisation réelle d'outils financiers
- OmniEval : un benchmark d'évaluation RAG omnidirectionnel pour le domaine financier
- Étude sur la détection d'anomalies par LLM (NAACL 2025) : Une taxonomie robuste, une couverture tabulaire absente
- Found in the Middle : Calibrer le biais d'attention positionnelle améliore le RAG à long contexte
- Report avec détection d'incertitude pour les agents LLM : quand passer d'un petit à un grand modèle
Automation
Automation techniques and tools for financial data processing workflows
- Les agents LLM peuvent-ils être directeurs financiers ? La simulation sur 132 mois d'EnterpriseArena révèle un écart important
- WildToolBench : Pourquoi aucun LLM ne dépasse 15 % de précision par session dans l'utilisation d'outils en conditions réelles
- JSONSchemaBench : la complexité des schémas réels brise les garanties de sortie structurée des LLM
- FinMCP-Bench : Évaluation des agents LLM pour l'utilisation d'outils financiers réels sous MCP
- FinTrace : Évaluation au niveau de la trajectoire de l'appel d'outils par les LLM pour les tâches financières
- FinToolBench : Évaluation des agents LLM sur l'utilisation réelle d'outils financiers
- OmniEval : un benchmark d'évaluation RAG omnidirectionnel pour le domaine financier
- Found in the Middle : Calibrer le biais d'attention positionnelle améliore le RAG à long contexte
- Report avec détection d'incertitude pour les agents LLM : quand passer d'un petit à un grand modèle
- OpenHands : une plateforme ouverte pour les agents logiciels d'IA et son impact sur l'automatisation de la finance
- TableMaster : Raisonnement adaptatif pour la compréhension de tableaux avec les LLM
- Détection d'anomalies Zero-Shot avec les LLM : performances de GPT-4 sur les données tabulaires
Data Science
Data science methods applied to financial datasets and accounting workflows
- FinRAGBench-V : RAG multimodal avec citations visuelles dans le domaine financier
- WildToolBench : Pourquoi aucun LLM ne dépasse 15 % de précision par session dans l'utilisation d'outils en conditions réelles
- Confiance et calibration des LLM : une étude de ce que montre réellement la recherche
- FinToolBench : Évaluation des agents LLM sur l'utilisation réelle d'outils financiers
- OmniEval : un benchmark d'évaluation RAG omnidirectionnel pour le domaine financier
- Étude sur la détection d'anomalies par LLM (NAACL 2025) : Une taxonomie robuste, une couverture tabulaire absente
- Found in the Middle : Calibrer le biais d'attention positionnelle améliore le RAG à long contexte
- Fin-RATE : Comment les LLM échouent dans l'analyse financière multi-périodes et multi-entités
- FinDER : Les requêtes réelles des analystes révèlent un écart de rappel de 74 % dans le RAG financier
- Perdu au milieu : le biais de position dans les LLM et son impact sur l'IA financière
- Benchmark AD-LLM : GPT-4o atteint un AUROC de 0,93+ en Zero-Shot pour la détection d'anomalies textuelles
- CausalTAD : Ordonnancement causal des colonnes pour la détection d'anomalies tabulaires par LLM
Finance
Financial research, analysis, and domain knowledge for accounting AI
- FinRAGBench-V : RAG multimodal avec citations visuelles dans le domaine financier
- Confiance et calibration des LLM : une étude de ce que montre réellement la recherche
- FinTrace : Évaluation au niveau de la trajectoire de l'appel d'outils par les LLM pour les tâches financières
- OmniEval : un benchmark d'évaluation RAG omnidirectionnel pour le domaine financier
- FinDER : Les requêtes réelles des analystes révèlent un écart de rappel de 74 % dans le RAG financier
- Perdu au milieu : le biais de position dans les LLM et son impact sur l'IA financière
- AnoLLM : Fine-Tuning de LLM pour la détection d'anomalies tabulaires dans les données financières
- DocFinQA : Raisonnement financier à contexte long sur l'intégralité des dépôts SEC
- TheAgentCompany : Évaluation des agents LLM sur des tâches d'entreprise en conditions réelles
- InvestorBench : Qwen2.5-72B en tête des actions avec un CR de 46,15 %
- Agent unique : égal à MAS sur multi-sauts à tokens égaux
- M3MAD-Bench : Les débats multi-agents sont-ils réellement efficaces à travers les domaines et les modalités ?
Plain-Text Accounting
Research grounded in plain-text accounting formats and workflows
- Votre agent peut-il équilibrer ces livres ?
- Report avec détection d'incertitude pour les agents LLM : quand passer d'un petit à un grand modèle
- OpenHands : une plateforme ouverte pour les agents logiciels d'IA et son impact sur l'automatisation de la finance
- Les LLM obtiennent un score de 2,3 % sur la génération du DSL Beancount : le benchmark LLMFinLiteracy
- TableMaster : Raisonnement adaptatif pour la compréhension de tableaux avec les LLM
- τ²-bench : mesurer le coût du double contrôle dans les agents IA conversationnels
- Benchmark GAIA : Mesurer ce que les agents IA de pointe peuvent réellement faire
- WorkArena : comment les agents Web LLM se comportent face au travail de connaissance réel en entreprise
- τ-bench : Mesurer la fiabilité des agents IA dans des domaines réels d'utilisation d'outils
- Chain-of-Table : Évolution des tableaux dans la chaîne de raisonnement des LLM
- TableLlama : un modèle ouvert de 7B peut-il égaler GPT-4 en compréhension de tableaux ?
- TAPAS : Table QA supervisé de manière faible sans SQL, et ce que cela signifie pour Beancount
Notre approche de la recherche
Texte brut d'abord
Nous partons de livres en texte brut pour que les données d’entrée restent lisibles, portables et consultables.
Reproductible par défaut
Nous explicitons les données d’entrée, les méthodes et les limites pour permettre à chacun d’examiner le travail et de le prolonger.
Résultats ouverts
Nous publions ouvertement nos notes et invitons la communauté à questionner, enrichir et améliorer les conclusions.
Suivre la recherche
Lisez les notes publiées et suivez les prochaines questions dans le journal de recherche.