پرش به محتوای اصلی

Mike Thrift

مدیر بازاریابی

TAT-QA: معیار ارزیابی پرسش و پاسخ ترکیبی جدول-متن برای استدلال در گزارش‌های سالانه مالی

TAT-QA یک معیار ارزیابی با ۱۶,۵۵۲ پرسش روی متن‌های گزارش مالی ترکیبی (جدول به علاوه متن) است که نشان داد اتکا به شواهد — و نه محاسبات ریاضی — گلوگاه اصلی در هوش مصنوعی مالی است؛ تا سال ۲۰۲۴، مدل‌های زبانی ۷ میلیاردی تنظیم‌شده به دقت F1 ۸۳٪ رسیدند و بیشتر شکاف با سقف ۹۱ درصدی انسانی را پر کردند.

FinQA: محک سنجش استدلال عددی هوش مصنوعی در گزارش‌های مالی

FinQA (EMNLP 2021) با ایجاد ۸,۲۸۱ جفت پرسش و پاسخ از گزارش‌های سوددهی S&P 500 که نیازمند برنامه‌های محاسباتی چند مرحله‌ای هستند، بنا شده است. مدل‌های عصبی در زمان انتشار امتیاز ۶۱٪ را در مقابل ۹۱٪ خبرگان انسانی کسب کردند؛ دقت در برنامه‌های سه مرحله‌ای یا بیشتر به ۲۲٪ کاهش می‌یابد. حالت‌های شکست — ثابت‌های حوزه، اتصال متقابل (cross-modality grounding)، طول زنجیره — مستقیماً با چالش‌هایی که امروزه ایجنت‌های Beancount با آن روبرو هستند، همسو است.

FinanceBench: چرا RAG مبتنی بر ذخیره‌ساز برداری در اسناد مالی واقعی شکست می‌خورد

FinanceBench ۱۶ پیکربندی هوش مصنوعی را در برابر ۱۰،۲۳۱ سوال از پرونده‌های واقعی SEC ارزیابی می‌کند؛ RAG با ذخیره‌ساز برداری مشترک تنها در ۱۹٪ مواقع پاسخ صحیح می‌دهد و حتی GPT-4-Turbo با داشتن قطعه متن مرجع (oracle) تنها به دقت ۸۵٪ می‌رسد — این نشان می‌دهد که استدلال عددی، و نه بازیابی اطلاعات، محدودیت اصلی هوش مصنوعی مالی سازمانی است.

DSPy: جایگزینی مهندسی پرامپت شکننده با خط‌لوله‌های کامپایل‌شده مدل زبانی بزرگ (LLM)

DSPy رشته‌های پرامپت دست‌ساز را با امضاهای اخباری و یک کامپایلر مبتنی بر معیار جایگزین می‌کند—عملکرد Llama2-13b را در استدلال ریاضی GSM8K از ۹.۴٪ به ۴۶.۹٪ می‌رساند و مسیری قابل‌نگهداری‌تر برای خط‌لوله‌های هوش مصنوعی مالی در محیط عملیاتی ارائه می‌دهد.

LATS: جستجوی درخت عامل زبانی — استدلال، عمل و برنامه‌ریزی در یک چارچوب واحد

LATS (جستجوی درخت عامل زبانی، ICML 2024) ReAct، درخت افکار و Reflexion را در یک چارچوب واحد MCTS یکپارچه می‌کند و به 92.7٪ pass@1 در HumanEval با GPT-4 می‌رسد. برای دفترهای Beancount مبتنی بر git، الزام بازگرداندن حالت که LATS را در تولید محدود می‌کند، به‌طور پیش‌پاافتاده برآورده می‌شود.

Self-RAG: بازیابی تطبیقی و خود-انتقادی برای مدل‌های زبانی بزرگ

Self-RAG (ارائه شفاهی ICLR 2024) یک مدل زبانی را آموزش می‌دهد تا تصمیم بگیرد چه زمانی بازیابی را انجام دهد و سپس نتایج خود را با استفاده از چهار توکن بازتابی رتبه‌بندی کند — دستیابی به ۵۵.۸٪ در PopQA و ۸۰.۲ FactScore در بیوگرافی‌ها در حالی که در پنج معیار از ChatGPT پیشی گرفته است. این تحلیل شامل مکانیسم، نتایج حذف اجزا (ablation)، محدودیت‌های بازتولید و پیامدهای آن برای ایجنت‌های هوش مصنوعی مالی روی دفترکل‌های Beancount است.

AgentBench: ارزیابی LLMها بهعنوان عاملها — درسهایی برای پایایی هوش مصنوعی مالی

AgentBench (Liu و همکاران، ICLR 2024) ۲۷ LLM را در ۸ محیط تعاملی محک میزند — GPT-4 با نمره ۴.۰۱ کلی در برابر ۰.۹۶ برای بهترین مدل متنباز. سه حالت شکست غالب (تجاوز از حد وظیفه در ۶۷.۹٪ شکستهای گراف دانش، خطاهای فرمت در ۵۳.۳٪ شکستهای پایگاهداده، و کنشهای نامعتبر) مستقیم به خطرهای استقرار عامل نوشتن-بازگشت Beancount بر یک دفترکل واقعی نگاشت میشوند.

BloombergGPT و محدودیت‌های مدل‌های زبانی بزرگ تخصصی در امور مالی

بلومبرگ یک مدل زبانی ۵۰ میلیارد پارامتری را با ۵۶۹ میلیارد توکن از داده‌های مالی آموزش داد و در بنچ‌مارک‌های تحلیل احساسات و استدلال جدولی بر مدل‌های عمومی پیروز شد — سپس GPT-4 بدون هیچ پیش‌آموزش اختصاصی مالی، با آن برابری کرد. آنچه این آزمایش ۱۰ میلیون دلاری درباره موازنه‌های پیش‌آموزش دامنه، توکن‌سازی اعداد و چرایی قابل‌اعتمادتر بودن استفاده از ابزارها نسبت به ساختار داخلی مدل برای عامل‌های حسابداری فاش می‌کند.

AutoGen: چارچوب‌های گفتگوی چند-عاملی برای هوش مصنوعی مالی

AutoGen (وو و همکاران، ۲۰۲۳) یک چارچوب گفتگوی چند-عاملی را معرفی می‌کند که در آن عامل‌های مبتنی بر مدل‌های زبانی بزرگ (LLM) برای تکمیل وظایف پیام مبادله می‌کنند؛ یک پیکربندی دو-عاملی دقت بنچمارک MATH را از ۵۵٪ به ۶۹٪ افزایش می‌دهد و یک عامل اختصاصی SafeGuard تشخیص کدهای ناامن را تا ۳۵ واحد F1 بهبود می‌بخشد — یافته‌هایی که مستقیماً در ساخت خط‌لوله‌های اتوماسیون امن و ماژولار Beancount کاربرد دارند.

گوریلا: چگونه آموزش آگاه از بازیابی توهمات API در مدل‌های زبانی بزرگ را از ۷۸٪ به ۱۱٪ کاهش می‌دهد

گوریلا (Patil et al., NeurIPS 2024) یک مدل LLaMA 7B را با آموزش آگاه از بازیابی (RAT) بر روی مستندات API بازیابی شده تنظیم دقیق می‌کند و نرخ توهم را در مقایسه با GPT-4 از ۷۸٪ به ۱۱٪ کاهش می‌دهد. این موضوع پیامدهای مستقیمی برای عوامل هوش مصنوعی مالی دارد که در آن‌ها نام‌های حساب اشتباه یا علامت‌های معکوس، به جای مزاحمت، خطاهای جدی در صحت داده‌ها محسوب می‌شوند.