Bean Labs
Дослідження меж автономного фінансового інтелекту.
Дослідницька ініціатива Beancount.io
Bean Labs публікує відкриті наукові нотатки про автономну бухгалтерію — мовні моделі, що міркують над подвійними записами, створюють перевірені аудиторські сліди та залишаються в межах бухгалтерії на основі звичайного тексту.
Останні дослідницькі нотатки
Відкриті експерименти та результати від Bean Labs — дослідницької ініціативи Finance AI Agent від Beancount.io.
Дослідження за темами
Переглядайте журнал досліджень за темами, до яких ми звертаємося найчастіше.
LLM
Large language model research with applications in financial tasks
- Чи збалансує ваш агент ці книги?
- FinRAGBench-V: Мультимодальний RAG із візуальним цитуванням у фінансовій сфері
- Чи можуть LLM-агенти бути фінансовими директорами? 132-місячна симуляція EnterpriseArena виявляє великий розрив
- WildToolBench: Чому жодна LLM не перевищує 15% точності сесії при реальному використанні інструментів
- Впевненість та калібрування LLM: Огляд того, що насправді показують дослідження
- JSONSchemaBench: Складність реальних схем порушує гарантії структурованого виводу LLM
- FinMCP-Bench: Бенчмаркінг агентів LLM для реального використання фінансових інструментів під управлінням MCP
- FinTrace: оцінка виклику інструментів LLM для фінансових завдань на рівні траєкторії
- FinToolBench: Оцінювання LLM-агентів у реальному використанні фінансових інструментів
- OmniEval: всебічний бенчмарк для оцінки RAG-систем у фінансовій сфері
- Огляд виявлення аномалій за допомогою LLM (NAACL 2025): сильна таксономія, відсутність охоплення табличних даних
- Знайдено посередині: Калібрування позиційного зміщення уваги покращує RAG з довгим контекстом
AI
Artificial intelligence research and applications in finance and accounting
- FinRAGBench-V: Мультимодальний RAG із візуальним цитуванням у фінансовій сфері
- Чи можуть LLM-агенти бути фінансовими директорами? 132-місячна симуляція EnterpriseArena виявляє великий розрив
- WildToolBench: Чому жодна LLM не перевищує 15% точності сесії при реальному використанні інструментів
- Впевненість та калібрування LLM: Огляд того, що насправді показують дослідження
- JSONSchemaBench: Складність реальних схем порушує гарантії структурованого виводу LLM
- FinMCP-Bench: Бенчмаркінг агентів LLM для реального використання фінансових інструментів під управлінням MCP
- FinTrace: оцінка виклику інструментів LLM для фінансових завдань на рівні траєкторії
- FinToolBench: Оцінювання LLM-агентів у реальному використанні фінансових інструментів
- OmniEval: всебічний бенчмарк для оцінки RAG-систем у фінансовій сфері
- Огляд виявлення аномалій за допомогою LLM (NAACL 2025): сильна таксономія, відсутність охоплення табличних даних
- Знайдено посередині: Калібрування позиційного зміщення уваги покращує RAG з довгим контекстом
- Передавання завдань з урахуванням невизначеності для агентів LLM: коли переходити від малих до великих моделей
Machine Learning
Machine learning techniques for financial data analysis and automation
- FinRAGBench-V: Мультимодальний RAG із візуальним цитуванням у фінансовій сфері
- WildToolBench: Чому жодна LLM не перевищує 15% точності сесії при реальному використанні інструментів
- Впевненість та калібрування LLM: Огляд того, що насправді показують дослідження
- JSONSchemaBench: Складність реальних схем порушує гарантії структурованого виводу LLM
- FinMCP-Bench: Бенчмаркінг агентів LLM для реального використання фінансових інструментів під управлінням MCP
- FinTrace: оцінка виклику інструментів LLM для фінансових завдань на рівні траєкторії
- FinToolBench: Оцінювання LLM-агентів у реальному використанні фінансових інструментів
- OmniEval: всебічний бенчмарк для оцінки RAG-систем у фінансовій сфері
- Огляд виявлення аномалій за допомогою LLM (NAACL 2025): сильна таксономія, відсутність охоплення табличних даних
- Знайдено посередині: Калібрування позиційного зміщення уваги покращує RAG з довгим контекстом
- Передавання завдань з урахуванням невизначеності для агентів LLM: коли переходити від малих до великих моделей
- OpenHands: Відкрита платформа для програмних агентів ШІ та що вона означає для автоматизації фінансів
Beancount
Beancount ledger format, tooling, and ecosystem research
- Чи збалансує ваш агент ці книги?
- FinRAGBench-V: Мультимодальний RAG із візуальним цитуванням у фінансовій сфері
- Чи можуть LLM-агенти бути фінансовими директорами? 132-місячна симуляція EnterpriseArena виявляє великий розрив
- WildToolBench: Чому жодна LLM не перевищує 15% точності сесії при реальному використанні інструментів
- JSONSchemaBench: Складність реальних схем порушує гарантії структурованого виводу LLM
- FinMCP-Bench: Бенчмаркінг агентів LLM для реального використання фінансових інструментів під управлінням MCP
- FinTrace: оцінка виклику інструментів LLM для фінансових завдань на рівні траєкторії
- FinToolBench: Оцінювання LLM-агентів у реальному використанні фінансових інструментів
- OmniEval: всебічний бенчмарк для оцінки RAG-систем у фінансовій сфері
- Огляд виявлення аномалій за допомогою LLM (NAACL 2025): сильна таксономія, відсутність охоплення табличних даних
- Знайдено посередині: Калібрування позиційного зміщення уваги покращує RAG з довгим контекстом
- Передавання завдань з урахуванням невизначеності для агентів LLM: коли переходити від малих до великих моделей
Automation
Automation techniques and tools for financial data processing workflows
- Чи можуть LLM-агенти бути фінансовими директорами? 132-місячна симуляція EnterpriseArena виявляє великий розрив
- WildToolBench: Чому жодна LLM не перевищує 15% точності сесії при реальному використанні інструментів
- JSONSchemaBench: Складність реальних схем порушує гарантії структурованого виводу LLM
- FinMCP-Bench: Бенчмаркінг агентів LLM для реального використання фінансових інструментів під управлінням MCP
- FinTrace: оцінка виклику інструментів LLM для фінансових завдань на рівні траєкторії
- FinToolBench: Оцінювання LLM-агентів у реальному використанні фінансових інструментів
- OmniEval: всебічний бенчмарк для оцінки RAG-систем у фінансовій сфері
- Знайдено посередині: Калібрування позиційного зміщення уваги покращує RAG з довгим контекстом
- Передавання завдань з урахуванням невизначеності для агентів LLM: коли переходити від малих до великих моделей
- OpenHands: Відкрита платформа для програмних агентів ШІ та що вона означає для автоматизації фінансів
- TableMaster: адаптивне міркування для розуміння таблиць за допомогою LLM
- Виявлення аномалій за методом Zero-Shot за допомогою LLM: Як GPT-4 працює з табличними даними
Data Science
Data science methods applied to financial datasets and accounting workflows
- FinRAGBench-V: Мультимодальний RAG із візуальним цитуванням у фінансовій сфері
- WildToolBench: Чому жодна LLM не перевищує 15% точності сесії при реальному використанні інструментів
- Впевненість та калібрування LLM: Огляд того, що насправді показують дослідження
- FinToolBench: Оцінювання LLM-агентів у реальному використанні фінансових інструментів
- OmniEval: всебічний бенчмарк для оцінки RAG-систем у фінансовій сфері
- Огляд виявлення аномалій за допомогою LLM (NAACL 2025): сильна таксономія, відсутність охоплення табличних даних
- Знайдено посередині: Калібрування позиційного зміщення уваги покращує RAG з довгим контекстом
- Fin-RATE: Як LLM зазнають невдачі у міжперіодному та міжсуб'єктному фінансовому аналізі
- FinDER: реальні запити аналітиків виявили 74% розриву в повноті фінансових RAG-систем
- Загублені посередині: упередженість щодо позиції в LLM та її вплив на ШІ у сфері фінансів
- Бенчмарк AD-LLM: GPT-4o досягає 0.93+ AUROC Zero-Shot для виявлення аномалій у тексті
- CausalTAD: Каузальне впорядкування стовпців для виявлення аномалій у табличних даних за допомогою LLM
Finance
Financial research, analysis, and domain knowledge for accounting AI
- FinRAGBench-V: Мультимодальний RAG із візуальним цитуванням у фінансовій сфері
- Впевненість та калібрування LLM: Огляд того, що насправді показують дослідження
- FinTrace: оцінка виклику інструментів LLM для фінансових завдань на рівні траєкторії
- OmniEval: всебічний бенчмарк для оцінки RAG-систем у фінансовій сфері
- FinDER: реальні запити аналітиків виявили 74% розриву в повноті фінансових RAG-систем
- Загублені посередині: упередженість щодо позиції в LLM та її вплив на ШІ у сфері фінансів
- AnoLLM: тонке налаштування LLM для виявлення аномалій у табличних фінансових даних
- DocFinQA: Фінансове міркування в довгому контексті на повних звітах SEC
- TheAgentCompany: Бенчмаркінг агентів LLM на реальних корпоративних завданнях
- InvestorBench: Qwen2.5-72B очолює акції з CR 46,15%
- Один агент: дорівнює MAS на багатокрокових завданнях за однакової кількості токенів
- M3MAD-Bench: Чи справді багатоагентні дебати ефективні в різних доменах та модальностях?
Plain-Text Accounting
Research grounded in plain-text accounting formats and workflows
- Чи збалансує ваш агент ці книги?
- Передавання завдань з урахуванням невизначеності для агентів LLM: коли переходити від малих до великих моделей
- OpenHands: Відкрита платформа для програмних агентів ШІ та що вона означає для автоматизації фінансів
- LLM отримують 2,3% за генерацію Beancount DSL: бенчмарк LLMFinLiteracy
- TableMaster: адаптивне міркування для розуміння таблиць за допомогою LLM
- τ²-bench: Вимірювання вартості подвійного керування в розмовних ШІ-агентах
- Бенчмарк GAIA: Вимірювання того, що провідні ШІ-агенти насправді можуть робити
- WorkArena: Як вебагенти на базі LLM справляються з реальною інтелектуальною працею на підприємствах
- τ-bench: Вимірювання надійності ШІ-агентів у реальних сценаріях використання інструментів
- Chain-of-Table: Evolving Tables in the LLM Reasoning Chain
- TableLlama: Чи може відкрита модель 7B зрівнятися з GPT-4 у розумінні таблиць?
- TAPAS: Слабко контрольоване табличне QA без SQL та його значення для Beancount
Наш підхід до досліджень
Відкритий текст перш за все
Ми починаємо з книг у звичайному тексті, щоб вхідні дані залишалися читабельними, переносними й відкритими для перевірки.
Відтворювано за замовчуванням
Ми чітко описуємо вхідні дані, методи й обмеження, щоб інші могли вивчати роботу та розвивати її.
Відкриті результати
Ми відкрито публікуємо дослідницькі нотатки й запрошуємо спільноту обговорювати, доповнювати та покращувати висновки.
Стежити за дослідженнями
Читайте опубліковані нотатки та стежте за наступними питаннями в журналі досліджень.