Bean Labs
Исследование границ автономного финансового интеллекта.
Исследовательская инициатива Beancount.io
Bean Labs публикует открытые исследовательские заметки об автономной бухгалтерии — языковые модели, которые рассуждают о двойной записи, создают проверяемые аудиторские следы и остаются на платформе plain-text accounting.
Последние исследовательские заметки
Открытые эксперименты и результаты Bean Labs — исследовательской инициативы Finance AI Agent от Beancount.io.
Исследования по темам
Просматривайте журнал исследований по темам, к которым мы обращаемся чаще всего.
LLM
Large language model research with applications in financial tasks
- Сможет ли ваш агент свести эти книги?
- FinRAGBench-V: мультимодальный RAG с визуальными цитатами в финансовой сфере
- Могут ли LLM-агенты быть финансовыми директорами? 132-месячная симуляция EnterpriseArena выявляет огромный разрыв
- WildToolBench: Почему ни одна LLM не превышает 15% точности сессии в реальных сценариях использования инструментов
- Уверенность и калибровка LLM: обзор того, что на самом деле показывают исследования
- JSONSchemaBench: Сложность реальных схем нарушает гарантии структурированного вывода LLM
- FinMCP-Bench: Тестирование LLM-агентов для решения реальных финансовых задач с использованием инструментов в рамках протокола MCP
- FinTrace: Оценка траекторий вызова инструментов LLM для финансовых задач
- FinToolBench: Оценка LLM-агентов на реальном использовании финансовых инструментов
- OmniEval: Всенаправленный бенчмарк для оценки RAG в финансовой сфере
- Обзор методов обнаружения аномалий с помощью LLM (NAACL 2025): сильная таксономия, отсутствие охвата табличных данных
- Найдено посередине: калибровка позиционного смещения внимания улучшает RAG с длинным контекстом
AI
Artificial intelligence research and applications in finance and accounting
- FinRAGBench-V: мультимодальный RAG с визуальными цитатами в финансовой сфере
- Могут ли LLM-агенты быть финансовыми директорами? 132-месячная симуляция EnterpriseArena выявляет огромный разрыв
- WildToolBench: Почему ни одна LLM не превышает 15% точности сессии в реальных сценариях использования инструментов
- Уверенность и калибровка LLM: обзор того, что на самом деле показывают исследования
- JSONSchemaBench: Сложность реальных схем нарушает гарантии структурированного вывода LLM
- FinMCP-Bench: Тестирование LLM-агентов для решения реальных финансовых задач с использованием инструментов в рамках протокола MCP
- FinTrace: Оценка траекторий вызова инструментов LLM для финансовых задач
- FinToolBench: Оценка LLM-агентов на реальном использовании финансовых инструментов
- OmniEval: Всенаправленный бенчмарк для оценки RAG в финансовой сфере
- Обзор методов обнаружения аномалий с помощью LLM (NAACL 2025): сильная таксономия, отсутствие охвата табличных данных
- Найдено посередине: калибровка позиционного смещения внимания улучшает RAG с длинным контекстом
- Учёт неопределенности при делегировании задач LLM-агентами: когда переходить от малых моделей к большим
Machine Learning
Machine learning techniques for financial data analysis and automation
- FinRAGBench-V: мультимодальный RAG с визуальными цитатами в финансовой сфере
- WildToolBench: Почему ни одна LLM не превышает 15% точности сессии в реальных сценариях использования инструментов
- Уверенность и калибровка LLM: обзор того, что на самом деле показывают исследования
- JSONSchemaBench: Сложность реальных схем нарушает гарантии структурированного вывода LLM
- FinMCP-Bench: Тестирование LLM-агентов для решения реальных финансовых задач с использованием инструментов в рамках протокола MCP
- FinTrace: Оценка траекторий вызова инструментов LLM для финансовых задач
- FinToolBench: Оценка LLM-агентов на реальном использовании финансовых инструментов
- OmniEval: Всенаправленный бенчмарк для оценки RAG в финансовой сфере
- Обзор методов обнаружения аномалий с помощью LLM (NAACL 2025): сильная таксономия, отсутствие охвата табличных данных
- Найдено посередине: калибровка позиционного смещения внимания улучшает RAG с длинным контекстом
- Учёт неопределенности при делегировании задач LLM-агентами: когда переходить от малых моделей к большим
- OpenHands: открытая платформа для ИИ-агентов-разработчиков и её значение для автоматизации финансов
Beancount
Beancount ledger format, tooling, and ecosystem research
- Сможет ли ваш агент свести эти книги?
- FinRAGBench-V: мультимодальный RAG с визуальными цитатами в финансовой сфере
- Могут ли LLM-агенты быть финансовыми директорами? 132-месячная симуляция EnterpriseArena выявляет огромный разрыв
- WildToolBench: Почему ни одна LLM не превышает 15% точности сессии в реальных сценариях использования инструментов
- JSONSchemaBench: Сложность реальных схем нарушает гарантии структурированного вывода LLM
- FinMCP-Bench: Тестирование LLM-агентов для решения реальных финансовых задач с использованием инструментов в рамках протокола MCP
- FinTrace: Оценка траекторий вызова инструментов LLM для финансовых задач
- FinToolBench: Оценка LLM-агентов на реальном использовании финансовых инструментов
- OmniEval: Всенаправленный бенчмарк для оценки RAG в финансовой сфере
- Обзор методов обнаружения аномалий с помощью LLM (NAACL 2025): сильная таксономия, отсутствие охвата табличных данных
- Найдено посередине: калибровка позиционного смещения внимания улучшает RAG с длинным контекстом
- Учёт неопределенности при делегировании задач LLM-агентами: когда переходить от малых моделей к большим
Automation
Automation techniques and tools for financial data processing workflows
- Могут ли LLM-агенты быть финансовыми директорами? 132-месячная симуляция EnterpriseArena выявляет огромный разрыв
- WildToolBench: Почему ни одна LLM не превышает 15% точности сессии в реальных сценариях использования инструментов
- JSONSchemaBench: Сложность реальных схем нарушает гарантии структурированного вывода LLM
- FinMCP-Bench: Тестирование LLM-агентов для решения реальных финансовых задач с использованием инструментов в рамках протокола MCP
- FinTrace: Оценка траекторий вызова инструментов LLM для финансовых задач
- FinToolBench: Оценка LLM-агентов на реальном использовании финансовых инструментов
- OmniEval: Всенаправленный бенчмарк для оценки RAG в финансовой сфере
- Найдено посередине: калибровка позиционного смещения внимания улучшает RAG с длинным контекстом
- Учёт неопределенности при делегировании задач LLM-агентами: когда переходить от малых моделей к большим
- OpenHands: открытая платформа для ИИ-агентов-разработчиков и её значение для автоматизации финансов
- TableMaster: адаптивное рассуждение для понимания таблиц с помощью LLM
- Zero-Shot обнаружение аномалий с помощью LLM: Как GPT-4 справляется с табличными данными
Data Science
Data science methods applied to financial datasets and accounting workflows
- FinRAGBench-V: мультимодальный RAG с визуальными цитатами в финансовой сфере
- WildToolBench: Почему ни одна LLM не превышает 15% точности сессии в реальных сценариях использования инструментов
- Уверенность и калибровка LLM: обзор того, что на самом деле показывают исследования
- FinToolBench: Оценка LLM-агентов на реальном использовании финансовых инструментов
- OmniEval: Всенаправленный бенчмарк для оценки RAG в финансовой сфере
- Обзор методов обнаружения аномалий с помощью LLM (NAACL 2025): сильная таксономия, отсутствие охвата табличных данных
- Найдено посередине: калибровка позиционного смещения внимания улучшает RAG с длинным контекстом
- Fin-RATE: Как LLM терпят неудачу в кросс-периодном и кросс-субъектном финансовом анализе
- FinDER: реальные запросы аналитиков выявили 74%-ный разрыв в полноте поиска для финансовых RAG-систем
- Затерянные посередине: позиционное смещение в LLM и его влияние на финансовый ИИ
- Бенчмарк AD-LLM: GPT-4o достигает 0,93+ AUROC в режиме Zero-Shot для обнаружения текстовых аномалий
- CausalTAD: каузальное упорядочивание столбцов для обнаружения аномалий в табличных данных с помощью LLM
Finance
Financial research, analysis, and domain knowledge for accounting AI
- FinRAGBench-V: мультимодальный RAG с визуальными цитатами в финансовой сфере
- Уверенность и калибровка LLM: обзор того, что на самом деле показывают исследования
- FinTrace: Оценка траекторий вызова инструментов LLM для финансовых задач
- OmniEval: Всенаправленный бенчмарк для оценки RAG в финансовой сфере
- FinDER: реальные запросы аналитиков выявили 74%-ный разрыв в полноте поиска для финансовых RAG-систем
- Затерянные посередине: позиционное смещение в LLM и его влияние на финансовый ИИ
- AnoLLM: Дообучение LLM для обнаружения аномалий в табличных финансовых данных
- DocFinQA: Рассуждения в длинном финансовом контексте на полных отчетах SEC
- TheAgentCompany: Бенчмаркинг LLM-агентов на реальных корпоративных задачах
- InvestorBench: Qwen2.5-72B занимает первое место по акциям с CR 46,15%
- Single-Agent: сравнение с MAS на многошаговых задачах при равном количестве токенов
- M3MAD-Bench: Действительно ли многоагентные дебаты эффективны в различных областях и модальностях?
Plain-Text Accounting
Research grounded in plain-text accounting formats and workflows
- Сможет ли ваш агент свести эти книги?
- Учёт неопределенности при делегировании задач LLM-агентами: когда переходить от малых моделей к большим
- OpenHands: открытая платформа для ИИ-агентов-разработчиков и её значение для автоматизации финансов
- LLM набирают 2,3% при генерации Beancount DSL: бенчмарк LLMFinLiteracy
- TableMaster: адаптивное рассуждение для понимания таблиц с помощью LLM
- τ²-bench: Оценка стоимости двойного управления в разговорных ИИ-агентах
- Бенчмарк GAIA: оценка реальных возможностей передовых ИИ-агентов
- WorkArena: Как LLM веб-агенты справляются с реальными задачами по обработке корпоративных знаний
- τ-bench: Измерение надежности ИИ-агентов в реальных сценариях использования инструментов
- Chain-of-Table: Эволюция таблиц в цепочке рассуждений LLM
- TableLlama: Может ли открытая модель 7B сравниться с GPT-4 в понимании таблиц?
- TAPAS: слабо контролируемое табличное QA без SQL и что это значит для Beancount
Наш подход к исследованиям
Сначала открытый текст
Мы начинаем с книг в обычном тексте, чтобы исходные данные оставались читаемыми, переносимыми и доступными для проверки.
Воспроизводимо по умолчанию
Мы явно описываем входные данные, методы и ограничения, чтобы другие могли изучать работу и развивать её.
Открытые результаты
Мы открыто публикуем исследовательские заметки и приглашаем сообщество обсуждать, дополнять и улучшать выводы.
Следить за исследованиями
Читайте опубликованные заметки и следите за следующими вопросами в журнале исследований.