
FinRAGBench-V: Мультимодальний RAG із візуальним цитуванням у фінансовій сфері
FinRAGBench-V: найкращі моделі сягають лише 20–61% recall цитат на рівні блоків на фінансових сторінках. Мультимодальний пошук випереджає текстовий майже на 50 пунктів.
#ai
Дослідження та застосування штучного інтелекту у фінансах та бухгалтерії

FinRAGBench-V: найкращі моделі сягають лише 20–61% recall цитат на рівні блоків на фінансових сторінках. Мультимодальний пошук випереджає текстовий майже на 50 пунктів.

Лише Qwen3.5-9B витримує 80% із 132 місяців CFO в EnterpriseArena, тоді як GPT-5.4 і DeepSeek-V3.1 дають 0%. Причина збоїв — пропущене звіряння реєстру.

WildToolBench: жодна LLM не перевищує 15% сесійної точності на 1 024 завданнях реальних користувачів, а найгостріші збої — прихований намір і переходи інструкцій.

Вербалізована впевненість GPT-4 сягає лише ~62,7% AUROC — ледь вище за випадковість. Фінансовим агентам з урахуванням невизначеності потрібне краще калібрування.

JSONSchemaBench: покриття падає з 86% на простих схемах до 3% на складних, тож структурований вивід LLM може непомітно давати невідповідний JSON.

FinMCP-Bench оцінює найкращу з шести LLM лише в 3,08% точного збігу на 613 реальних фінансових задачах MCP — 20-кратний обвал від одного інструмента до багатокроковості.

FinTrace показує: передові LLM обирають правильні фінансові інструменти (F1 ~0,9), але мають лише 3,23/5 за використання результатів — саме цей крок ламає агентів запису.

FinToolBench виявляє невідповідність намірів понад 50% у кожної протестованої LLM, тож агресивні виклики інструментів не дають кращих відповідей у фінансах.

OmniEval оцінює найкращі RAG-системи лише у 36% числової точності за 5 типами фінансових завдань, тож агентам для леджерів потрібна валідація перед записом проводок.

Таксономія NAACL 2025 залишається чинною, але табличні дані поза увагою. Командам фінансового AI доведеться самим адаптувати методи для vision-моделей.

Віднімання позиційного зсуву з ваг уваги LLM повертає до 15 пунктів точності RAG, коли доказ лежить у середині контексту, допомагаючи конвеєрам фінансових агентів.

ReDAct делегує від малої моделі до великої лише коли перплексія сигналізує про невизначеність, скорочуючи витрати на 64% за тієї ж точності для агентних робочих процесів.