Bean Labs
Pesquisando os limites da inteligência financeira autônoma.
Uma iniciativa de pesquisa da Beancount.io
O Bean Labs publica notas de pesquisa abertas sobre contabilidade autônoma — modelos de linguagem que raciocinam sobre livros-razão de partidas dobradas, produzem trilhas de auditoria verificáveis e permanecem fundamentados na contabilidade de texto simples.
Notas de pesquisa recentes
Experimentos e descobertas abertos do Bean Labs — a iniciativa de pesquisa Finance AI Agent da Beancount.io.
Pesquisa por tópico
Explore o registro de pesquisa pelos temas que abordamos com mais frequência.
LLM
Large language model research with applications in financial tasks
- Seu agente consegue equilibrar estes livros?
- FinRAGBench-V: RAG Multimodal com Citações Visuais no Domínio Financeiro
- Agentes de LLM podem ser CFOs? Simulação de 132 meses do EnterpriseArena revela uma grande lacuna
- WildToolBench: Por que nenhum LLM excede 15% de acurácia de sessão no uso de ferramentas no mundo real
- Confiança e Calibração em LLM: Um Levantamento do que a Pesquisa Realmente Mostra
- JSONSchemaBench: Complexidade de Esquemas do Mundo Real Quebra Garantias de Saída Estruturada de LLMs
- FinMCP-Bench: Benchmarking de Agentes de LLM para Uso de Ferramentas Financeiras no Mundo Real sob MCP
- FinTrace: Avaliação em Nível de Trajetória de Chamada de Ferramentas de LLM para Tarefas Financeiras
- FinToolBench: Avaliando Agentes de LLM no Uso Real de Ferramentas Financeiras
- OmniEval: Benchmark de Avaliação de RAG Omnidirecional para o Domínio Financeiro
- Levantamento sobre Detecção de Anomalias com LLM (NAACL 2025): Taxonomia Forte, Cobertura Tabular Ausente
- Encontrado no Meio: Calibrar o Viés de Atenção Posicional Melhora o RAG de Contexto Longo
AI
Artificial intelligence research and applications in finance and accounting
- FinRAGBench-V: RAG Multimodal com Citações Visuais no Domínio Financeiro
- Agentes de LLM podem ser CFOs? Simulação de 132 meses do EnterpriseArena revela uma grande lacuna
- WildToolBench: Por que nenhum LLM excede 15% de acurácia de sessão no uso de ferramentas no mundo real
- Confiança e Calibração em LLM: Um Levantamento do que a Pesquisa Realmente Mostra
- JSONSchemaBench: Complexidade de Esquemas do Mundo Real Quebra Garantias de Saída Estruturada de LLMs
- FinMCP-Bench: Benchmarking de Agentes de LLM para Uso de Ferramentas Financeiras no Mundo Real sob MCP
- FinTrace: Avaliação em Nível de Trajetória de Chamada de Ferramentas de LLM para Tarefas Financeiras
- FinToolBench: Avaliando Agentes de LLM no Uso Real de Ferramentas Financeiras
- OmniEval: Benchmark de Avaliação de RAG Omnidirecional para o Domínio Financeiro
- Levantamento sobre Detecção de Anomalias com LLM (NAACL 2025): Taxonomia Forte, Cobertura Tabular Ausente
- Encontrado no Meio: Calibrar o Viés de Atenção Posicional Melhora o RAG de Contexto Longo
- Diferimento Ciente de Incerteza para Agentes LLM: Quando Escalar de Modelos Pequenos para Grandes
Machine Learning
Machine learning techniques for financial data analysis and automation
- FinRAGBench-V: RAG Multimodal com Citações Visuais no Domínio Financeiro
- WildToolBench: Por que nenhum LLM excede 15% de acurácia de sessão no uso de ferramentas no mundo real
- Confiança e Calibração em LLM: Um Levantamento do que a Pesquisa Realmente Mostra
- JSONSchemaBench: Complexidade de Esquemas do Mundo Real Quebra Garantias de Saída Estruturada de LLMs
- FinMCP-Bench: Benchmarking de Agentes de LLM para Uso de Ferramentas Financeiras no Mundo Real sob MCP
- FinTrace: Avaliação em Nível de Trajetória de Chamada de Ferramentas de LLM para Tarefas Financeiras
- FinToolBench: Avaliando Agentes de LLM no Uso Real de Ferramentas Financeiras
- OmniEval: Benchmark de Avaliação de RAG Omnidirecional para o Domínio Financeiro
- Levantamento sobre Detecção de Anomalias com LLM (NAACL 2025): Taxonomia Forte, Cobertura Tabular Ausente
- Encontrado no Meio: Calibrar o Viés de Atenção Posicional Melhora o RAG de Contexto Longo
- Diferimento Ciente de Incerteza para Agentes LLM: Quando Escalar de Modelos Pequenos para Grandes
- OpenHands: Plataforma Aberta para Agentes de Software de IA e o que Isso Significa para a Automação Financeira
Beancount
Beancount ledger format, tooling, and ecosystem research
- Seu agente consegue equilibrar estes livros?
- FinRAGBench-V: RAG Multimodal com Citações Visuais no Domínio Financeiro
- Agentes de LLM podem ser CFOs? Simulação de 132 meses do EnterpriseArena revela uma grande lacuna
- WildToolBench: Por que nenhum LLM excede 15% de acurácia de sessão no uso de ferramentas no mundo real
- JSONSchemaBench: Complexidade de Esquemas do Mundo Real Quebra Garantias de Saída Estruturada de LLMs
- FinMCP-Bench: Benchmarking de Agentes de LLM para Uso de Ferramentas Financeiras no Mundo Real sob MCP
- FinTrace: Avaliação em Nível de Trajetória de Chamada de Ferramentas de LLM para Tarefas Financeiras
- FinToolBench: Avaliando Agentes de LLM no Uso Real de Ferramentas Financeiras
- OmniEval: Benchmark de Avaliação de RAG Omnidirecional para o Domínio Financeiro
- Levantamento sobre Detecção de Anomalias com LLM (NAACL 2025): Taxonomia Forte, Cobertura Tabular Ausente
- Encontrado no Meio: Calibrar o Viés de Atenção Posicional Melhora o RAG de Contexto Longo
- Diferimento Ciente de Incerteza para Agentes LLM: Quando Escalar de Modelos Pequenos para Grandes
Automation
Automation techniques and tools for financial data processing workflows
- Agentes de LLM podem ser CFOs? Simulação de 132 meses do EnterpriseArena revela uma grande lacuna
- WildToolBench: Por que nenhum LLM excede 15% de acurácia de sessão no uso de ferramentas no mundo real
- JSONSchemaBench: Complexidade de Esquemas do Mundo Real Quebra Garantias de Saída Estruturada de LLMs
- FinMCP-Bench: Benchmarking de Agentes de LLM para Uso de Ferramentas Financeiras no Mundo Real sob MCP
- FinTrace: Avaliação em Nível de Trajetória de Chamada de Ferramentas de LLM para Tarefas Financeiras
- FinToolBench: Avaliando Agentes de LLM no Uso Real de Ferramentas Financeiras
- OmniEval: Benchmark de Avaliação de RAG Omnidirecional para o Domínio Financeiro
- Encontrado no Meio: Calibrar o Viés de Atenção Posicional Melhora o RAG de Contexto Longo
- Diferimento Ciente de Incerteza para Agentes LLM: Quando Escalar de Modelos Pequenos para Grandes
- OpenHands: Plataforma Aberta para Agentes de Software de IA e o que Isso Significa para a Automação Financeira
- TableMaster: Raciocínio Adaptativo para Compreensão de Tabelas com LLMs
- Detecção de Anomalias Zero-Shot com LLMs: Como o GPT-4 se Comporta em Dados Tabulares
Data Science
Data science methods applied to financial datasets and accounting workflows
- FinRAGBench-V: RAG Multimodal com Citações Visuais no Domínio Financeiro
- WildToolBench: Por que nenhum LLM excede 15% de acurácia de sessão no uso de ferramentas no mundo real
- Confiança e Calibração em LLM: Um Levantamento do que a Pesquisa Realmente Mostra
- FinToolBench: Avaliando Agentes de LLM no Uso Real de Ferramentas Financeiras
- OmniEval: Benchmark de Avaliação de RAG Omnidirecional para o Domínio Financeiro
- Levantamento sobre Detecção de Anomalias com LLM (NAACL 2025): Taxonomia Forte, Cobertura Tabular Ausente
- Encontrado no Meio: Calibrar o Viés de Atenção Posicional Melhora o RAG de Contexto Longo
- Fin-RATE: Como os LLMs falham na análise financeira entre períodos e entre entidades
- FinDER: Consultas de Analistas Reais Expõem uma Lacuna de 74% de Recall em RAG Financeiro
- Perdido no Meio: Viés de Posição em LLMs e seu Impacto na IA Financeira
- Benchmark AD-LLM: GPT-4o Alcança 0,93+ AUROC Zero-Shot para Detecção de Anomalias em Texto
- CausalTAD: Ordenação Causal de Colunas para Detecção de Anomalias Tabulares via LLM
Finance
Financial research, analysis, and domain knowledge for accounting AI
- FinRAGBench-V: RAG Multimodal com Citações Visuais no Domínio Financeiro
- Confiança e Calibração em LLM: Um Levantamento do que a Pesquisa Realmente Mostra
- FinTrace: Avaliação em Nível de Trajetória de Chamada de Ferramentas de LLM para Tarefas Financeiras
- OmniEval: Benchmark de Avaliação de RAG Omnidirecional para o Domínio Financeiro
- FinDER: Consultas de Analistas Reais Expõem uma Lacuna de 74% de Recall em RAG Financeiro
- Perdido no Meio: Viés de Posição em LLMs e seu Impacto na IA Financeira
- AnoLLM: Ajuste Fino de LLMs para Detecção de Anomalias em Dados Tabulares Financeiros
- DocFinQA: Raciocínio Financeiro de Longo Contexto em Arquivos Completos da SEC
- TheAgentCompany: Avaliando Agentes de LLM em Tarefas Empresariais do Mundo Real
- InvestorBench: Qwen2.5-72B lidera ações com CR de 46,15%
- Agente Único: iguala o MAS em multi-hop com tokens equivalentes
- M3MAD-Bench: Os Debates Multi-Agente São Realmente Eficazes em Diferentes Domínios e Modalidades?
Plain-Text Accounting
Research grounded in plain-text accounting formats and workflows
- Seu agente consegue equilibrar estes livros?
- Diferimento Ciente de Incerteza para Agentes LLM: Quando Escalar de Modelos Pequenos para Grandes
- OpenHands: Plataforma Aberta para Agentes de Software de IA e o que Isso Significa para a Automação Financeira
- LLMs pontuam 2,3% na Geração de DSL Beancount: O Benchmark LLMFinLiteracy
- TableMaster: Raciocínio Adaptativo para Compreensão de Tabelas com LLMs
- τ²-bench: Medindo o Custo do Controle Duplo em Agentes de IA Conversacionais
- Benchmark GAIA: Medindo o Que os Agentes de IA de Fronteira Realmente Conseguem Fazer
- WorkArena: Como Agentes Web de LLM se Comportam em Trabalho de Conhecimento Empresarial Real
- τ-bench: Medindo a Confiabilidade de Agentes de IA em Domínios de Uso de Ferramentas no Mundo Real
- Chain-of-Table: Evoluindo Tabelas na Cadeia de Raciocínio de LLMs
- TableLlama: Pode um Modelo Aberto de 7B Igualar o GPT-4 na Compreensão de Tabelas?
- TAPAS: Table QA Fracamente Supervisionado Sem SQL, e o Que Isso Significa para o Beancount
Nossa abordagem à pesquisa
Texto simples primeiro
Partimos de livros contábeis em texto simples para que os dados de entrada permaneçam legíveis, portáteis e abertos à inspeção.
Reproduzível por padrão
Explicitamos os dados de entrada, os métodos e as limitações para que outras pessoas possam examinar o trabalho e desenvolvê-lo.
Descobertas abertas
Publicamos notas de pesquisa abertamente e convidamos a comunidade a questionar, ampliar e melhorar os resultados.
Acompanhe a pesquisa
Leia as notas publicadas e acompanhe as próximas perguntas no diário de pesquisa.