
آیا عامل شما میتواند این حسابها را تراز کند؟
یک اجرای عامل دفتر کل سهردیفی را با ۲۹۵۸.۵۰ دلار حساب جاری و ۱۹۵۸.۵۰ دلار سود سپتامبر تطبیق داد و از شکستی که خود تشخیص داد بازیابی کرد.
#plain-text-accounting
پژوهشی مبتنی بر قالبها و گردشکارهای حسابداری متنساده

یک اجرای عامل دفتر کل سهردیفی را با ۲۹۵۸.۵۰ دلار حساب جاری و ۱۹۵۸.۵۰ دلار سود سپتامبر تطبیق داد و از شکستی که خود تشخیص داد بازیابی کرد.

ReDAct تنها زمانی از یک مدل کوچک به بزرگ تعویق میاندازد که پرپلکسیتی عدم قطعیت را نشان دهد، هزینه را 64% با دقت مطابق برای جریانهای کاری عامل کاهش میدهد.

عامل CodeAct در OpenHands در SWE-Bench Lite ۲۶٪ میگیرد؛ یعنی کار مطمئن امروز محدود است. اتوماسیون مالی باید محدود آغاز شود، نه خودمختار.

LLMFinLiteracy مییابد پنج مدل ~۷B تنها ۲.۳٪ مواقع تراکنشهای درست Beancount مینویسند و در استدلال حسابداری، نه نحو، شکست میخورند.

TableMaster با GPT-4o-mini به 78.13% در WikiTQ میرسد، 13 واحد بالاتر از Chain-of-Table، از طریق جدول تمرکز بهعلاوه استدلال تطبیقی برای عاملها روی دفترهای کل Beancount.

τ²-bench نشان میدهد کاربران فعال با ابزارهای خودشان، موفقیت عامل گفتوگویی را ۱۸ تا ۲۵ واحد کاهش میدهند. عاملهای Beancount با دسترسی نوشتن مشترک هم همینطور میبازند.

466 وظیفه GAIA نشان میدهد عاملهای AI پیشرو به 74.55% میرسند در برابر 92% برای انسانها، و هماهنگی سطح 3 همچنان سختترین شکاف برای پر کردن است.

33 وظیفه ServiceNow در WorkArena نشان میدهد GPT-4o در کل 42.7% است اما در فیلترهای فهرست 0%، دیواری که تعامل ساختاریافته با رابط کاربری باید از آن عبور کند.

τ-bench نشان میدهد LLMهای برتر در وظایف ابزاری خردهفروشی از pass@1 0.692 به pass@4 0.462 میافتند. عامل نوشتنی روی دفتر کل هم همین پرتگاه را دارد.

Chain-of-Table به 67.31% در WikiTQ میرسد در برابر 61.48% برای زنجیره تفکر فقط متنی، و با 10.25 واحد در جداول بالای 4,000 توکن پیشتاز است.

TableLlama در حاشیهنویسی نوع ستون GPT-4 را شکست میدهد (F1 ۹۴ در برابر ۳۲) اما در استدلال ترکیبی WikiTQ ۳۳ امتیاز عقب است.

TAPAS به سؤالات جدولی با انتخاب سلولها پاسخ میدهد، هرگز SQL تولید نمیکند. برای پرسوجوهای کوچک دفتر کل Beancount مناسب است اما در مقیاس بزرگ شکست میخورد.