Bean Labs
Investigando los límites de la inteligencia financiera autónoma.
Una iniciativa de investigación de Beancount.io
Bean Labs publica notas de investigación abiertas sobre contabilidad autónoma: modelos de lenguaje que razonan sobre libros mayores de partida doble, producen pistas de auditoría verificables y se mantienen anclados en la contabilidad de texto plano.
Notas de investigación recientes
Experimentos y hallazgos abiertos de Bean Labs — la iniciativa de investigación Finance AI Agent de Beancount.io.
Investigación por tema
Explore el registro de investigación por los temas a los que volvemos con más frecuencia.
LLM
Large language model research with applications in financial tasks
- ¿Puede tu agente cuadrar estos libros?
- FinRAGBench-V: RAG multimodal con citas visuales en el dominio financiero
- ¿Pueden los agentes de LLM ser Directores Financieros? La simulación de 132 meses de EnterpriseArena revela una brecha considerable
- WildToolBench: Por qué ningún LLM supera el 15% de precisión de sesión en el uso de herramientas en el mundo real
- Confianza y calibración de LLM: Un estudio de lo que la investigación muestra realmente
- JSONSchemaBench: La complejidad de los esquemas del mundo real rompe las garantías de salida estructurada de los LLM
- FinMCP-Bench: Benchmarking de agentes de LLM para el uso de herramientas financieras del mundo real bajo MCP
- FinTrace: Evaluación a Nivel de Trayectoria del Llamado a Herramientas de LLM para Tareas Financieras
- FinToolBench: Evaluando Agentes LLM en el Uso de Herramientas Financieras del Mundo Real
- OmniEval: Benchmark de evaluación RAG omnidireccional para el dominio financiero
- Estudio sobre detección de anomalías con LLM (NAACL 2025): taxonomía sólida, cobertura tabular ausente
- Encontrado en el medio: La calibración del sesgo de atención posicional mejora el RAG de contexto largo
AI
Artificial intelligence research and applications in finance and accounting
- FinRAGBench-V: RAG multimodal con citas visuales en el dominio financiero
- ¿Pueden los agentes de LLM ser Directores Financieros? La simulación de 132 meses de EnterpriseArena revela una brecha considerable
- WildToolBench: Por qué ningún LLM supera el 15% de precisión de sesión en el uso de herramientas en el mundo real
- Confianza y calibración de LLM: Un estudio de lo que la investigación muestra realmente
- JSONSchemaBench: La complejidad de los esquemas del mundo real rompe las garantías de salida estructurada de los LLM
- FinMCP-Bench: Benchmarking de agentes de LLM para el uso de herramientas financieras del mundo real bajo MCP
- FinTrace: Evaluación a Nivel de Trayectoria del Llamado a Herramientas de LLM para Tareas Financieras
- FinToolBench: Evaluando Agentes LLM en el Uso de Herramientas Financieras del Mundo Real
- OmniEval: Benchmark de evaluación RAG omnidireccional para el dominio financiero
- Estudio sobre detección de anomalías con LLM (NAACL 2025): taxonomía sólida, cobertura tabular ausente
- Encontrado en el medio: La calibración del sesgo de atención posicional mejora el RAG de contexto largo
- Aplazamiento con Conciencia de Incertidumbre para Agentes LLM: Cuándo Escalar de Modelos Pequeños a Grandes
Machine Learning
Machine learning techniques for financial data analysis and automation
- FinRAGBench-V: RAG multimodal con citas visuales en el dominio financiero
- WildToolBench: Por qué ningún LLM supera el 15% de precisión de sesión en el uso de herramientas en el mundo real
- Confianza y calibración de LLM: Un estudio de lo que la investigación muestra realmente
- JSONSchemaBench: La complejidad de los esquemas del mundo real rompe las garantías de salida estructurada de los LLM
- FinMCP-Bench: Benchmarking de agentes de LLM para el uso de herramientas financieras del mundo real bajo MCP
- FinTrace: Evaluación a Nivel de Trayectoria del Llamado a Herramientas de LLM para Tareas Financieras
- FinToolBench: Evaluando Agentes LLM en el Uso de Herramientas Financieras del Mundo Real
- OmniEval: Benchmark de evaluación RAG omnidireccional para el dominio financiero
- Estudio sobre detección de anomalías con LLM (NAACL 2025): taxonomía sólida, cobertura tabular ausente
- Encontrado en el medio: La calibración del sesgo de atención posicional mejora el RAG de contexto largo
- Aplazamiento con Conciencia de Incertidumbre para Agentes LLM: Cuándo Escalar de Modelos Pequeños a Grandes
- OpenHands: Plataforma abierta para agentes de software de IA y lo que significa para la automatización financiera
Beancount
Beancount ledger format, tooling, and ecosystem research
- ¿Puede tu agente cuadrar estos libros?
- FinRAGBench-V: RAG multimodal con citas visuales en el dominio financiero
- ¿Pueden los agentes de LLM ser Directores Financieros? La simulación de 132 meses de EnterpriseArena revela una brecha considerable
- WildToolBench: Por qué ningún LLM supera el 15% de precisión de sesión en el uso de herramientas en el mundo real
- JSONSchemaBench: La complejidad de los esquemas del mundo real rompe las garantías de salida estructurada de los LLM
- FinMCP-Bench: Benchmarking de agentes de LLM para el uso de herramientas financieras del mundo real bajo MCP
- FinTrace: Evaluación a Nivel de Trayectoria del Llamado a Herramientas de LLM para Tareas Financieras
- FinToolBench: Evaluando Agentes LLM en el Uso de Herramientas Financieras del Mundo Real
- OmniEval: Benchmark de evaluación RAG omnidireccional para el dominio financiero
- Estudio sobre detección de anomalías con LLM (NAACL 2025): taxonomía sólida, cobertura tabular ausente
- Encontrado en el medio: La calibración del sesgo de atención posicional mejora el RAG de contexto largo
- Aplazamiento con Conciencia de Incertidumbre para Agentes LLM: Cuándo Escalar de Modelos Pequeños a Grandes
Automation
Automation techniques and tools for financial data processing workflows
- ¿Pueden los agentes de LLM ser Directores Financieros? La simulación de 132 meses de EnterpriseArena revela una brecha considerable
- WildToolBench: Por qué ningún LLM supera el 15% de precisión de sesión en el uso de herramientas en el mundo real
- JSONSchemaBench: La complejidad de los esquemas del mundo real rompe las garantías de salida estructurada de los LLM
- FinMCP-Bench: Benchmarking de agentes de LLM para el uso de herramientas financieras del mundo real bajo MCP
- FinTrace: Evaluación a Nivel de Trayectoria del Llamado a Herramientas de LLM para Tareas Financieras
- FinToolBench: Evaluando Agentes LLM en el Uso de Herramientas Financieras del Mundo Real
- OmniEval: Benchmark de evaluación RAG omnidireccional para el dominio financiero
- Encontrado en el medio: La calibración del sesgo de atención posicional mejora el RAG de contexto largo
- Aplazamiento con Conciencia de Incertidumbre para Agentes LLM: Cuándo Escalar de Modelos Pequeños a Grandes
- OpenHands: Plataforma abierta para agentes de software de IA y lo que significa para la automatización financiera
- TableMaster: Razonamiento Adaptativo para la Comprensión de Tablas con LLMs
- Detección de anomalías Zero-Shot con LLM: Cómo se desempeña GPT-4 en datos tabulares
Data Science
Data science methods applied to financial datasets and accounting workflows
- FinRAGBench-V: RAG multimodal con citas visuales en el dominio financiero
- WildToolBench: Por qué ningún LLM supera el 15% de precisión de sesión en el uso de herramientas en el mundo real
- Confianza y calibración de LLM: Un estudio de lo que la investigación muestra realmente
- FinToolBench: Evaluando Agentes LLM en el Uso de Herramientas Financieras del Mundo Real
- OmniEval: Benchmark de evaluación RAG omnidireccional para el dominio financiero
- Estudio sobre detección de anomalías con LLM (NAACL 2025): taxonomía sólida, cobertura tabular ausente
- Encontrado en el medio: La calibración del sesgo de atención posicional mejora el RAG de contexto largo
- Fin-RATE: Cómo fallan los LLM en el análisis financiero entre periodos y entre entidades
- FinDER: Consultas Reales de Analistas Exponen una Brecha de Recuperación del 74% en RAG Financiero
- Perdidos en el medio: El sesgo de posición en los LLM y su impacto en la IA financiera
- AD-LLM Benchmark: GPT-4o alcanza un AUROC de 0,93+ en Zero-Shot para la detección de anomalías en texto
- CausalTAD: Ordenación causal de columnas para la detección de anomalías en tablas con LLM
Finance
Financial research, analysis, and domain knowledge for accounting AI
- FinRAGBench-V: RAG multimodal con citas visuales en el dominio financiero
- Confianza y calibración de LLM: Un estudio de lo que la investigación muestra realmente
- FinTrace: Evaluación a Nivel de Trayectoria del Llamado a Herramientas de LLM para Tareas Financieras
- OmniEval: Benchmark de evaluación RAG omnidireccional para el dominio financiero
- FinDER: Consultas Reales de Analistas Exponen una Brecha de Recuperación del 74% en RAG Financiero
- Perdidos en el medio: El sesgo de posición en los LLM y su impacto en la IA financiera
- AnoLLM: Ajuste Fino de LLMs para la Detección de Anomalías Tabulares en Datos Financieros
- DocFinQA: Razonamiento financiero de contexto largo en presentaciones completas de la SEC
- TheAgentCompany: Evaluación Comparativa de Agentes de LLM en Tareas Empresariales del Mundo Real
- InvestorBench: Qwen2.5-72B lidera en acciones con un 46,15% de CR
- Agente único: iguala a MAS en múltiples saltos con tokens equivalentes
- M3MAD-Bench: ¿Son los debates multi-agente realmente efectivos en todos los dominios y modalidades?
Plain-Text Accounting
Research grounded in plain-text accounting formats and workflows
- ¿Puede tu agente cuadrar estos libros?
- Aplazamiento con Conciencia de Incertidumbre para Agentes LLM: Cuándo Escalar de Modelos Pequeños a Grandes
- OpenHands: Plataforma abierta para agentes de software de IA y lo que significa para la automatización financiera
- Los LLM obtienen un 2,3% en la generación de DSL de Beancount: El benchmark LLMFinLiteracy
- TableMaster: Razonamiento Adaptativo para la Comprensión de Tablas con LLMs
- τ²-bench: Midiendo el costo del control dual en agentes de IA conversacional
- Benchmark GAIA: Midiendo lo que los agentes de IA de vanguardia realmente pueden hacer
- WorkArena: Cómo se desempeñan los agentes web de LLM en el trabajo de conocimiento empresarial real
- τ-bench: Midiendo la confiabilidad de los agentes de IA en dominios de uso de herramientas del mundo real
- Chain-of-Table: Evolución de tablas en la cadena de razonamiento de LLM
- TableLlama: ¿Puede un modelo abierto de 7B igualar a GPT-4 en la comprensión de tablas?
- TAPAS: Table QA débilmente supervisado sin SQL y qué significa para Beancount
Nuestro enfoque de investigación
Texto plano primero
Partimos de libros contables en texto plano para que los datos de entrada sigan siendo legibles, portables y abiertos a revisión.
Reproducible por defecto
Hacemos explícitos los datos de entrada, los métodos y las limitaciones para que otros puedan examinar el trabajo y ampliarlo.
Hallazgos abiertos
Publicamos notas de investigación abiertamente e invitamos a la comunidad a cuestionar, ampliar y mejorar los hallazgos.
Sigue la investigación
Lee las notas publicadas y sigue las próximas preguntas en el registro de investigación.