
FinMCP-Bench: معیار سنجش عاملهای LLM برای استفاده از ابزارهای مالی واقعی تحت MCP
FinMCP-Bench بهترین از شش LLM را تنها ۳.۰۸٪ تطابق دقیق در ۶۱۳ وظیفه واقعی مالی MCP میسنجد؛ سقوطی ۲۰ برابری از تکابزار به چندنوبت.
#fintech
پژوهش فناوری مالی، پلتفرمها و زیرساخت برای سیستمهای حسابداری مدرن

FinMCP-Bench بهترین از شش LLM را تنها ۳.۰۸٪ تطابق دقیق در ۶۱۳ وظیفه واقعی مالی MCP میسنجد؛ سقوطی ۲۰ برابری از تکابزار به چندنوبت.

FinTrace نشان میدهد LLMهای پیشرو ابزارهای مالی درست را برمیگزینند (F1 ~۰.۹) اما تنها ۳.۲۳/۵ در استفاده از نتایج میگیرند؛ همان گامی که عاملهای بازنویسی را میشکند.

FinToolBench نشان میدهد عدمتطابق قصد برای هر LLM آزمایششده بالای ۵۰٪ است؛ پس فراخوانی تهاجمی ابزار به معنای پاسخهای بهتر در وظایف مالی نیست.

BloombergGPT روی ۵۶۹B توکن مالی آموزش دید، اما GPT-4 بدون پیشآموزش مالی با آن برابر شد. برای عاملهای حسابداری، استفاده از ابزار بر درون مدل برتری دارد.