Bean Labs
Esplorare i confini dell'intelligenza finanziaria autonoma.
Un'iniziativa di ricerca di Beancount.io
Bean Labs pubblica note di ricerca aperte sulla contabilità autonoma: modelli linguistici che ragionano sui registri a partita doppia, producono tracce di audit verificabili e restano ancorati alla contabilità basata su testo semplice.
Note di ricerca recenti
Esperimenti e risultati aperti di Bean Labs — l'iniziativa di ricerca Finance AI Agent di Beancount.io.
Ricerca per argomento
Esplora il registro di ricerca attraverso i temi a cui torniamo più spesso.
LLM
Large language model research with applications in financial tasks
- Il tuo agente riesce a quadrare questi libri contabili?
- FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario
- I CFO con Agenti LLM Possono Davvero Funzionare? La Simulazione di 132 Mesi di EnterpriseArena Rivela un Ampio Divario
- WildToolBench: Perché nessun LLM supera il 15% di accuratezza di sessione nell'uso di strumenti reali
- Confidenza e Calibrazione degli LLM: Una Rassegna su Quanto Mostra Realmente la Ricerca
- JSONSchemaBench: La complessità degli schemi reali mette in crisi le garanzie di output strutturato degli LLM
- FinMCP-Bench: Valutazione di Agenti LLM per l'Uso di Strumenti Finanziari Reali tramite MCP
- FinTrace: Valutazione a Livello di Traiettoria della Chiamata a Strumenti LLM per Compiti Finanziari
- FinToolBench: Valutare gli Agenti LLM sull'Uso Reale di Strumenti Finanziari
- OmniEval: Benchmark di Valutazione RAG Omnidirezionale per il Dominio Finanziario
- Survey sull'Anomaly Detection con LLM (NAACL 2025): Tassonomia Solida, Copertura su Dati Tabulari Assente
- Trovato nel Mezzo: La Calibrazione del Bias di Attenzione Posizionale Migliora il RAG a Contesto Lungo
AI
Artificial intelligence research and applications in finance and accounting
- FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario
- I CFO con Agenti LLM Possono Davvero Funzionare? La Simulazione di 132 Mesi di EnterpriseArena Rivela un Ampio Divario
- WildToolBench: Perché nessun LLM supera il 15% di accuratezza di sessione nell'uso di strumenti reali
- Confidenza e Calibrazione degli LLM: Una Rassegna su Quanto Mostra Realmente la Ricerca
- JSONSchemaBench: La complessità degli schemi reali mette in crisi le garanzie di output strutturato degli LLM
- FinMCP-Bench: Valutazione di Agenti LLM per l'Uso di Strumenti Finanziari Reali tramite MCP
- FinTrace: Valutazione a Livello di Traiettoria della Chiamata a Strumenti LLM per Compiti Finanziari
- FinToolBench: Valutare gli Agenti LLM sull'Uso Reale di Strumenti Finanziari
- OmniEval: Benchmark di Valutazione RAG Omnidirezionale per il Dominio Finanziario
- Survey sull'Anomaly Detection con LLM (NAACL 2025): Tassonomia Solida, Copertura su Dati Tabulari Assente
- Trovato nel Mezzo: La Calibrazione del Bias di Attenzione Posizionale Migliora il RAG a Contesto Lungo
- Rinvio Consapevole dell'Incertezza per Agenti LLM: Quando Scalare da Modelli Piccoli a Grandi
Machine Learning
Machine learning techniques for financial data analysis and automation
- FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario
- WildToolBench: Perché nessun LLM supera il 15% di accuratezza di sessione nell'uso di strumenti reali
- Confidenza e Calibrazione degli LLM: Una Rassegna su Quanto Mostra Realmente la Ricerca
- JSONSchemaBench: La complessità degli schemi reali mette in crisi le garanzie di output strutturato degli LLM
- FinMCP-Bench: Valutazione di Agenti LLM per l'Uso di Strumenti Finanziari Reali tramite MCP
- FinTrace: Valutazione a Livello di Traiettoria della Chiamata a Strumenti LLM per Compiti Finanziari
- FinToolBench: Valutare gli Agenti LLM sull'Uso Reale di Strumenti Finanziari
- OmniEval: Benchmark di Valutazione RAG Omnidirezionale per il Dominio Finanziario
- Survey sull'Anomaly Detection con LLM (NAACL 2025): Tassonomia Solida, Copertura su Dati Tabulari Assente
- Trovato nel Mezzo: La Calibrazione del Bias di Attenzione Posizionale Migliora il RAG a Contesto Lungo
- Rinvio Consapevole dell'Incertezza per Agenti LLM: Quando Scalare da Modelli Piccoli a Grandi
- OpenHands: Piattaforma Aperta per Agenti Software AI e le sue Implicazioni per l'Automazione Finanziaria
Beancount
Beancount ledger format, tooling, and ecosystem research
- Il tuo agente riesce a quadrare questi libri contabili?
- FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario
- I CFO con Agenti LLM Possono Davvero Funzionare? La Simulazione di 132 Mesi di EnterpriseArena Rivela un Ampio Divario
- WildToolBench: Perché nessun LLM supera il 15% di accuratezza di sessione nell'uso di strumenti reali
- JSONSchemaBench: La complessità degli schemi reali mette in crisi le garanzie di output strutturato degli LLM
- FinMCP-Bench: Valutazione di Agenti LLM per l'Uso di Strumenti Finanziari Reali tramite MCP
- FinTrace: Valutazione a Livello di Traiettoria della Chiamata a Strumenti LLM per Compiti Finanziari
- FinToolBench: Valutare gli Agenti LLM sull'Uso Reale di Strumenti Finanziari
- OmniEval: Benchmark di Valutazione RAG Omnidirezionale per il Dominio Finanziario
- Survey sull'Anomaly Detection con LLM (NAACL 2025): Tassonomia Solida, Copertura su Dati Tabulari Assente
- Trovato nel Mezzo: La Calibrazione del Bias di Attenzione Posizionale Migliora il RAG a Contesto Lungo
- Rinvio Consapevole dell'Incertezza per Agenti LLM: Quando Scalare da Modelli Piccoli a Grandi
Automation
Automation techniques and tools for financial data processing workflows
- I CFO con Agenti LLM Possono Davvero Funzionare? La Simulazione di 132 Mesi di EnterpriseArena Rivela un Ampio Divario
- WildToolBench: Perché nessun LLM supera il 15% di accuratezza di sessione nell'uso di strumenti reali
- JSONSchemaBench: La complessità degli schemi reali mette in crisi le garanzie di output strutturato degli LLM
- FinMCP-Bench: Valutazione di Agenti LLM per l'Uso di Strumenti Finanziari Reali tramite MCP
- FinTrace: Valutazione a Livello di Traiettoria della Chiamata a Strumenti LLM per Compiti Finanziari
- FinToolBench: Valutare gli Agenti LLM sull'Uso Reale di Strumenti Finanziari
- OmniEval: Benchmark di Valutazione RAG Omnidirezionale per il Dominio Finanziario
- Trovato nel Mezzo: La Calibrazione del Bias di Attenzione Posizionale Migliora il RAG a Contesto Lungo
- Rinvio Consapevole dell'Incertezza per Agenti LLM: Quando Scalare da Modelli Piccoli a Grandi
- OpenHands: Piattaforma Aperta per Agenti Software AI e le sue Implicazioni per l'Automazione Finanziaria
- TableMaster: Ragionamento Adattivo per la Comprensione di Tabelle con LLM
- Rilevamento di Anomalie Zero-Shot con LLM: Come GPT-4 si Comporta sui Dati Tabulari
Data Science
Data science methods applied to financial datasets and accounting workflows
- FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario
- WildToolBench: Perché nessun LLM supera il 15% di accuratezza di sessione nell'uso di strumenti reali
- Confidenza e Calibrazione degli LLM: Una Rassegna su Quanto Mostra Realmente la Ricerca
- FinToolBench: Valutare gli Agenti LLM sull'Uso Reale di Strumenti Finanziari
- OmniEval: Benchmark di Valutazione RAG Omnidirezionale per il Dominio Finanziario
- Survey sull'Anomaly Detection con LLM (NAACL 2025): Tassonomia Solida, Copertura su Dati Tabulari Assente
- Trovato nel Mezzo: La Calibrazione del Bias di Attenzione Posizionale Migliora il RAG a Contesto Lungo
- Fin-RATE: Come gli LLM Falliscono nell'Analisi Finanziaria Inter-Periodo e Cross-Entità
- FinDER: Query di analisti reali rivelano un divario di recall del 74% nella RAG finanziaria
- Persi nel Mezzo: Bias Posizionale negli LLM e il Suo Impatto sull'AI Finanziaria
- Benchmark AD-LLM: GPT-4o Raggiunge AUROC 0,93+ Zero-Shot per il Rilevamento di Anomalie nel Testo
- CausalTAD: Ordinamento Causale delle Colonne per il Rilevamento di Anomalie Tabulari con LLM
Finance
Financial research, analysis, and domain knowledge for accounting AI
- FinRAGBench-V: RAG Multimodale con Citazioni Visive nel Dominio Finanziario
- Confidenza e Calibrazione degli LLM: Una Rassegna su Quanto Mostra Realmente la Ricerca
- FinTrace: Valutazione a Livello di Traiettoria della Chiamata a Strumenti LLM per Compiti Finanziari
- OmniEval: Benchmark di Valutazione RAG Omnidirezionale per il Dominio Finanziario
- FinDER: Query di analisti reali rivelano un divario di recall del 74% nella RAG finanziaria
- Persi nel Mezzo: Bias Posizionale negli LLM e il Suo Impatto sull'AI Finanziaria
- AnoLLM: Fine-Tuning di LLM per il Rilevamento di Anomalie Tabulari in Dati Finanziari
- DocFinQA: Ragionamento Finanziario su Contesto Lungo Basato su Documenti SEC Completi
- TheAgentCompany: Benchmark degli Agenti LLM su Compiti Aziendali Reali
- InvestorBench: Qwen2.5-72B guida le azioni con un CR del 46,15%
- Single-Agent: uguale a MAS su multi-hop a parità di token
- M3MAD-Bench: I dibattiti multi-agente sono davvero efficaci tra domini e modalità?
Plain-Text Accounting
Research grounded in plain-text accounting formats and workflows
- Il tuo agente riesce a quadrare questi libri contabili?
- Rinvio Consapevole dell'Incertezza per Agenti LLM: Quando Scalare da Modelli Piccoli a Grandi
- OpenHands: Piattaforma Aperta per Agenti Software AI e le sue Implicazioni per l'Automazione Finanziaria
- Gli LLM Ottengono il 2,3% sulla Generazione di DSL Beancount: Il Benchmark LLMFinLiteracy
- TableMaster: Ragionamento Adattivo per la Comprensione di Tabelle con LLM
- τ²-bench: Misurare il Controllo Duale negli Agenti Conversazionali di IA
- Benchmark GAIA: Misurare ciò che gli Agenti IA Frontier sanno realmente fare
- WorkArena: Come gli Agenti Web LLM si Comportano nel Lavoro Reale della Conoscenza Aziendale
- τ-bench: Misurare l'affidabilità degli agenti AI in domini reali di utilizzo di strumenti
- Chain-of-Table: Evoluzione delle Tabelle nella Catena di Ragionamento dei LLM
- TableLlama: un Modello Open da 7B può Eguagliare GPT-4 nella Comprensione delle Tabelle?
- TAPAS: Risposta a Domande su Tabelle con Supervisione Debole Senza SQL, e Cosa Significa per Beancount
Il nostro approccio alla ricerca
Prima il testo semplice
Partiamo da libri contabili in testo semplice, così che i dati di ingresso restino leggibili, portabili e verificabili.
Riproducibile per impostazione predefinita
Esplicitiamo dati di ingresso, metodi e limiti per consentire ad altri di esaminare il lavoro e ampliarlo.
Risultati aperti
Pubblichiamo apertamente le note di ricerca e invitiamo la comunità a mettere in discussione, ampliare e migliorare i risultati.
Segui la ricerca
Leggi le note pubblicate e segui le prossime domande nel diario di ricerca.