
WildToolBench: چرا هیچ مدل زبانی بزرگی در دقت جلسات استفاده از ابزار در دنیای واقعی از ۱۵٪ فراتر نمیرود
WildToolBench مییابد هیچ LLM از ۱۵٪ دقت نشست در ۱,۰۲۴ وظیفه کاربران واقعی فراتر نمیرود و قصد پنهان و گذارهای دستور، تیزترین حالتهای شکستاند.
#technology
موضوعات پژوهشی فناوری و مهندسی نرمافزار مرتبط با سیستمهای هوش مصنوعی مالی

WildToolBench مییابد هیچ LLM از ۱۵٪ دقت نشست در ۱,۰۲۴ وظیفه کاربران واقعی فراتر نمیرود و قصد پنهان و گذارهای دستور، تیزترین حالتهای شکستاند.

LLMها تا 20 واحد بدتر امتیاز میگیرند وقتی پاسخ در میانزمینه قرار دارد، بنابراین خطوط لوله RAG مالی باید بهترین قطعات را اول یا آخر قرار دهند.

OSWorld نشان میدهد عاملهای هوش مصنوعی دسکتاپ در 12.24% وظایف واقعی موفق میشوند در برابر 72.36% برای انسانها، با 75% شکستها ناشی از زمینگیری بینایی-حرکتی، نه استدلال.

StructRAG هر پرسوجو را به ساختار جدول، گراف، فهرست، الگوریتم یا قطعه مسیریابی میکند و GraphRAG را ۲۸ امتیاز شکست میدهد و ۲۲ برابر سریعتر اجرا میشود.

در بودجههای برابر توکن تفکر، مدلهای زبانی تکعاملی در استدلال چندمرحلهای با سیستمهای چندعاملی برابری یا برتری دارند—طراحیهای سادهتر عامل مالی را ترجیح دهید.

Self-RAG به LLM میآموزد تصمیم بگیرد چه زمانی بازیابی کند و نتایج را خودنمرهدهی کند، با ۵۵.۸٪ در PopQA و ۸۰.۲ FactScore — شکست ChatGPT در پنج بنچمارک.

AgentBench به GPT-4 نمره ۴.۰۱ در برابر ۰.۹۶ برای بهترین LLM متنباز داد. همان شکستها دقیقاً چیزی است که عامل نوشتنی Beancount را روی دفتر کل زنده میشکند.

لایههای حافظه سبک OS در MemGPT دقت چت چندنشستی GPT-4 را به ۹۲.۵٪ در برابر ۳۲.۱٪ زمینه ثابت میرساند—برای عاملهای دفترکل چندساله ضروری است.