Bean Labs
پژوهش در مرزهای هوش مالی خودمختار.
یک ابتکار پژوهشی توسط Beancount.io
Bean Labs یادداشتهای پژوهشی باز دربارهٔ دفترداری خودکار منتشر میکند — مدلهای زبانی که روی دفترهای دوبل استدلال میکنند، مسیرهای حسابرسی قابل تأیید تولید میکنند و در حسابداری متن ساده پایدار میمانند.
یادداشتهای پژوهشی اخیر
آزمایشها و یافتههای باز از Bean Labs — ابتکار پژوهشی Finance AI Agent از Beancount.io.
پژوهش بر اساس موضوع
گزارش پژوهشی را بر اساس موضوعاتی که بیشتر به آنها بازمیگردیم مرور کنید.
LLM
Large language model research with applications in financial tasks
- آیا عامل شما میتواند این حسابها را تراز کند؟
- FinRAGBench-V: RAG چندوجهی با استنادهای بصری در حوزه مالی
- آیا عاملهای LLM میتوانند مدیر مالی باشند؟ شبیهسازی ۱۳۲ ماهه EnterpriseArena شکاف بزرگی را فاش میکند
- WildToolBench: چرا هیچ مدل زبانی بزرگی در دقت جلسات استفاده از ابزار در دنیای واقعی از ۱۵٪ فراتر نمیرود
- اعتماد و کالیبراسیون LLM: مروری بر آنچه تحقیقات واقعاً نشان میدهند
- JSONSchemaBench: پیچیدگی شمای دنیای واقعی، تضمینهای خروجی ساختاریافته LLM را میشکند
- FinMCP-Bench: معیار سنجش عاملهای LLM برای استفاده از ابزارهای مالی واقعی تحت MCP
- FinTrace: ارزیابی در سطح مسیر فراخوانی ابزار توسط مدلهای زبانی بزرگ برای وظایف مالی
- FinToolBench: ارزیابی عوامل LLM در استفاده از ابزارهای مالی دنیای واقعی
- OmniEval: بنچمارک ارزیابی همهجانبه RAG برای حوزه مالی
- بررسی جامع تشخیص ناهنجاری با مدلهای زبانی بزرگ (NAACL 2025): طبقهبندی قوی، غیبت پوشش دادههای جدولی
- یافتن در میان: کالیبره کردن سوگیری توجه مکانی، RAG با بافت طولانی را بهبود میبخشد
AI
Artificial intelligence research and applications in finance and accounting
- FinRAGBench-V: RAG چندوجهی با استنادهای بصری در حوزه مالی
- آیا عاملهای LLM میتوانند مدیر مالی باشند؟ شبیهسازی ۱۳۲ ماهه EnterpriseArena شکاف بزرگی را فاش میکند
- WildToolBench: چرا هیچ مدل زبانی بزرگی در دقت جلسات استفاده از ابزار در دنیای واقعی از ۱۵٪ فراتر نمیرود
- اعتماد و کالیبراسیون LLM: مروری بر آنچه تحقیقات واقعاً نشان میدهند
- JSONSchemaBench: پیچیدگی شمای دنیای واقعی، تضمینهای خروجی ساختاریافته LLM را میشکند
- FinMCP-Bench: معیار سنجش عاملهای LLM برای استفاده از ابزارهای مالی واقعی تحت MCP
- FinTrace: ارزیابی در سطح مسیر فراخوانی ابزار توسط مدلهای زبانی بزرگ برای وظایف مالی
- FinToolBench: ارزیابی عوامل LLM در استفاده از ابزارهای مالی دنیای واقعی
- OmniEval: بنچمارک ارزیابی همهجانبه RAG برای حوزه مالی
- بررسی جامع تشخیص ناهنجاری با مدلهای زبانی بزرگ (NAACL 2025): طبقهبندی قوی، غیبت پوشش دادههای جدولی
- یافتن در میان: کالیبره کردن سوگیری توجه مکانی، RAG با بافت طولانی را بهبود میبخشد
- تعویق آگاه از عدم قطعیت برای عاملهای LLM: چه زمانی از مدلهای کوچک به بزرگ ارجاع دهیم
Machine Learning
Machine learning techniques for financial data analysis and automation
- FinRAGBench-V: RAG چندوجهی با استنادهای بصری در حوزه مالی
- WildToolBench: چرا هیچ مدل زبانی بزرگی در دقت جلسات استفاده از ابزار در دنیای واقعی از ۱۵٪ فراتر نمیرود
- اعتماد و کالیبراسیون LLM: مروری بر آنچه تحقیقات واقعاً نشان میدهند
- JSONSchemaBench: پیچیدگی شمای دنیای واقعی، تضمینهای خروجی ساختاریافته LLM را میشکند
- FinMCP-Bench: معیار سنجش عاملهای LLM برای استفاده از ابزارهای مالی واقعی تحت MCP
- FinTrace: ارزیابی در سطح مسیر فراخوانی ابزار توسط مدلهای زبانی بزرگ برای وظایف مالی
- FinToolBench: ارزیابی عوامل LLM در استفاده از ابزارهای مالی دنیای واقعی
- OmniEval: بنچمارک ارزیابی همهجانبه RAG برای حوزه مالی
- بررسی جامع تشخیص ناهنجاری با مدلهای زبانی بزرگ (NAACL 2025): طبقهبندی قوی، غیبت پوشش دادههای جدولی
- یافتن در میان: کالیبره کردن سوگیری توجه مکانی، RAG با بافت طولانی را بهبود میبخشد
- تعویق آگاه از عدم قطعیت برای عاملهای LLM: چه زمانی از مدلهای کوچک به بزرگ ارجاع دهیم
- OpenHands: پلتفرم باز برای عاملهای نرمافزاری هوش مصنوعی و معنای آن برای اتوماسیون مالی
Beancount
Beancount ledger format, tooling, and ecosystem research
- آیا عامل شما میتواند این حسابها را تراز کند؟
- FinRAGBench-V: RAG چندوجهی با استنادهای بصری در حوزه مالی
- آیا عاملهای LLM میتوانند مدیر مالی باشند؟ شبیهسازی ۱۳۲ ماهه EnterpriseArena شکاف بزرگی را فاش میکند
- WildToolBench: چرا هیچ مدل زبانی بزرگی در دقت جلسات استفاده از ابزار در دنیای واقعی از ۱۵٪ فراتر نمیرود
- JSONSchemaBench: پیچیدگی شمای دنیای واقعی، تضمینهای خروجی ساختاریافته LLM را میشکند
- FinMCP-Bench: معیار سنجش عاملهای LLM برای استفاده از ابزارهای مالی واقعی تحت MCP
- FinTrace: ارزیابی در سطح مسیر فراخوانی ابزار توسط مدلهای زبانی بزرگ برای وظایف مالی
- FinToolBench: ارزیابی عوامل LLM در استفاده از ابزارهای مالی دنیای واقعی
- OmniEval: بنچمارک ارزیابی همهجانبه RAG برای حوزه مالی
- بررسی جامع تشخیص ناهنجاری با مدلهای زبانی بزرگ (NAACL 2025): طبقهبندی قوی، غیبت پوشش دادههای جدولی
- یافتن در میان: کالیبره کردن سوگیری توجه مکانی، RAG با بافت طولانی را بهبود میبخشد
- تعویق آگاه از عدم قطعیت برای عاملهای LLM: چه زمانی از مدلهای کوچک به بزرگ ارجاع دهیم
Automation
Automation techniques and tools for financial data processing workflows
- آیا عاملهای LLM میتوانند مدیر مالی باشند؟ شبیهسازی ۱۳۲ ماهه EnterpriseArena شکاف بزرگی را فاش میکند
- WildToolBench: چرا هیچ مدل زبانی بزرگی در دقت جلسات استفاده از ابزار در دنیای واقعی از ۱۵٪ فراتر نمیرود
- JSONSchemaBench: پیچیدگی شمای دنیای واقعی، تضمینهای خروجی ساختاریافته LLM را میشکند
- FinMCP-Bench: معیار سنجش عاملهای LLM برای استفاده از ابزارهای مالی واقعی تحت MCP
- FinTrace: ارزیابی در سطح مسیر فراخوانی ابزار توسط مدلهای زبانی بزرگ برای وظایف مالی
- FinToolBench: ارزیابی عوامل LLM در استفاده از ابزارهای مالی دنیای واقعی
- OmniEval: بنچمارک ارزیابی همهجانبه RAG برای حوزه مالی
- یافتن در میان: کالیبره کردن سوگیری توجه مکانی، RAG با بافت طولانی را بهبود میبخشد
- تعویق آگاه از عدم قطعیت برای عاملهای LLM: چه زمانی از مدلهای کوچک به بزرگ ارجاع دهیم
- OpenHands: پلتفرم باز برای عاملهای نرمافزاری هوش مصنوعی و معنای آن برای اتوماسیون مالی
- TableMaster: استدلال تطبیقی برای درک جداول با مدلهای زبانی بزرگ (LLMs)
- تشخیص ناهنجاری بدون آموزش (Zero-Shot) با مدلهای زبانی بزرگ: عملکرد GPT-4 روی دادههای جدولی
Data Science
Data science methods applied to financial datasets and accounting workflows
- FinRAGBench-V: RAG چندوجهی با استنادهای بصری در حوزه مالی
- WildToolBench: چرا هیچ مدل زبانی بزرگی در دقت جلسات استفاده از ابزار در دنیای واقعی از ۱۵٪ فراتر نمیرود
- اعتماد و کالیبراسیون LLM: مروری بر آنچه تحقیقات واقعاً نشان میدهند
- FinToolBench: ارزیابی عوامل LLM در استفاده از ابزارهای مالی دنیای واقعی
- OmniEval: بنچمارک ارزیابی همهجانبه RAG برای حوزه مالی
- بررسی جامع تشخیص ناهنجاری با مدلهای زبانی بزرگ (NAACL 2025): طبقهبندی قوی، غیبت پوشش دادههای جدولی
- یافتن در میان: کالیبره کردن سوگیری توجه مکانی، RAG با بافت طولانی را بهبود میبخشد
- Fin-RATE: شکست مدلهای زبانی بزرگ در تحلیل مالی دورهای و بین-موجودیتی
- FinDER: پرسوجوهای واقعی تحلیلگران شکاف بازخوانی ۷۴ درصدی را در RAG مالی فاش میکنند
- گمشده در میان: سوگیری موقعیتی در مدلهای زبانی بزرگ و تأثیر آن بر هوش مصنوعی مالی
- بنچمارک AD-LLM: مدل GPT-4o به امتیاز AUROC بالای ۰.۹۳ در تشخیص ناهنجاری متنی بدون آموزش (Zero-Shot) دست یافت
- CausalTAD: ترتیببندی علّی ستونها برای تشخیص ناهنجاری جدولی در مدلهای زبانی بزرگ
Finance
Financial research, analysis, and domain knowledge for accounting AI
- FinRAGBench-V: RAG چندوجهی با استنادهای بصری در حوزه مالی
- اعتماد و کالیبراسیون LLM: مروری بر آنچه تحقیقات واقعاً نشان میدهند
- FinTrace: ارزیابی در سطح مسیر فراخوانی ابزار توسط مدلهای زبانی بزرگ برای وظایف مالی
- OmniEval: بنچمارک ارزیابی همهجانبه RAG برای حوزه مالی
- FinDER: پرسوجوهای واقعی تحلیلگران شکاف بازخوانی ۷۴ درصدی را در RAG مالی فاش میکنند
- گمشده در میان: سوگیری موقعیتی در مدلهای زبانی بزرگ و تأثیر آن بر هوش مصنوعی مالی
- AnoLLM: تنظیم دقیق مدلهای زبانی بزرگ (LLM) برای شناسایی ناهنجاریهای جدولی در دادههای مالی
- DocFinQA: استدلال مالی با متن طولانی بر روی گزارشهای کامل SEC
- TheAgentCompany: محکزنی عاملهای LLM در وظایف سازمانی دنیای واقعی
- InvestorBench: Qwen2.5-72B با نرخ موفقیت ۴۶.۱۵٪ در صدر معاملات سهام
- تکعاملی: در توکنهای برابر، عملکرد برابر با MAS در استدلال چندمرحلهای دارد
- M3MAD-Bench: آیا مباحثات چند-عاملی واقعاً در حوزهها و مدالیتههای مختلف موثر هستند؟
Plain-Text Accounting
Research grounded in plain-text accounting formats and workflows
- آیا عامل شما میتواند این حسابها را تراز کند؟
- تعویق آگاه از عدم قطعیت برای عاملهای LLM: چه زمانی از مدلهای کوچک به بزرگ ارجاع دهیم
- OpenHands: پلتفرم باز برای عاملهای نرمافزاری هوش مصنوعی و معنای آن برای اتوماسیون مالی
- امتیاز ۲.۳ درصدی مدلهای زبانی بزرگ در تولید DSL بینکنت: بنچمارک LLMFinLiteracy
- TableMaster: استدلال تطبیقی برای درک جداول با مدلهای زبانی بزرگ (LLMs)
- τ²-bench: اندازهگیری هزینه کنترل دوگانه در عاملهای هوش مصنوعی مکالمهای
- بنچمارک GAIA: اندازهگیری آنچه مدلهای هوش مصنوعی پیشرو واقعاً میتوانند انجام دهند
- WorkArena: نحوه عملکرد عاملهای وب مبتنی بر LLM در کارهای دانشی واقعی سازمانی
- τ-bench: سنجش قابلیت اطمینان عاملهای هوش مصنوعی در دامنههای واقعی استفاده از ابزار
- Chain-of-Table: تکامل جداول در زنجیره استدلال مدلهای زبانی بزرگ
- TableLlama: آیا یک مدل متنباز ۷ میلیاردی میتواند در درک جداول با GPT-4 رقابت کند؟
- TAPAS: پرسش و پاسخ جدولی با نظارت ضعیف بدون SQL، و معنای آن برای Beancount
رویکرد ما به پژوهش
متنباز اول
با دفترهای متن ساده آغاز میکنیم تا دادههای ورودی خوانا، قابلانتقال و قابلبررسی بمانند.
بهطور پیشفرض قابل تکرار
دادههای ورودی، روشها و محدودیتها را روشن بیان میکنیم تا دیگران بتوانند کار را بررسی و گسترش دهند.
یافتههای باز
یادداشتهای پژوهشی را آزادانه منتشر میکنیم و از جامعه میخواهیم یافتهها را نقد، گسترش و بهبود دهد.
پژوهش را دنبال کنید
یادداشتهای منتشرشده را بخوانید و پرسشهای بعدی را در دفتر پژوهش دنبال کنید.