پرش به محتوای اصلی

گزارش پژوهش

آزمایش‌ها و یافته‌های باز از Bean Labs — ابتکار پژوهشی Finance AI Agent از Beancount.io.

تعویق آگاه از عدم قطعیت برای عامل‌های LLM: چه زمانی از مدل‌های کوچک به بزرگ ارجاع دهیم

ReDAct تنها زمانی از یک مدل کوچک به بزرگ تعویق می‌اندازد که پرپلکسیتی عدم قطعیت را نشان دهد، هزینه را 64% با دقت مطابق برای جریان‌های کاری عامل کاهش می‌دهد.

FinDER: پرس‌وجوهای واقعی تحلیل‌گران شکاف بازخوانی ۷۴ درصدی را در RAG مالی فاش می‌کنند

۵,۷۰۳ پرس‌وجوی واقعی تحلیلگر در FinDER نشان می‌دهد برترین RAG تنها ۲۵.۹۵٪ شواهد 10-K را بازیابی می‌کند. نخست اختصارها را نرمال کنید، پیش از تغییر امبدینگ‌ها.

بنچ‌مارک AD-LLM: مدل GPT-4o به امتیاز AUROC بالای ۰.۹۳ در تشخیص ناهنجاری متنی بدون آموزش (Zero-Shot) دست یافت

AD-LLM نشان می‌دهد GPT-4o به 0.93–0.99 AUROC بدون نمونه برای تشخیص ناهنجاری متنی می‌رسد، اما انتخاب مدل LLM برای هوش مصنوعی حسابرسی مالی غیرقابل اعتماد می‌ماند.

AnoLLM: تنظیم دقیق مدل‌های زبانی بزرگ (LLM) برای شناسایی ناهنجاری‌های جدولی در داده‌های مالی

AnoLLM با امتیازدهی ردیف‌ها بر پایه لگاریتم درست‌نمایی منفی LLM از خطوط پایه کلاسیک در داده‌های تقلب با انواع مختلط پیشی می‌گیرد، اما در جداول کاملاً عددی برتری نمی‌افزاید.

تشخیص ناهنجاری بدون آموزش (Zero-Shot) با مدل‌های زبانی بزرگ: عملکرد GPT-4 روی داده‌های جدولی

GPT-4 به میانگین AUROC 74.1 در ODDS بدون نمونه می‌رسد، نزدیک به خط پایه 75.5 ECOD، اما در داده‌های با واریانس بالا شکست می‌خورد. حسابرسی دفتر کل هنوز حل نشده است.