
Чи збалансує ваш агент ці книги?
Один запуск агента звірив леджер із трьох рядків до 2958.50 USD на рахунку checking і 1958.50 USD вересневого прибутку, відновившись після збою, який він сам діагностував.
#llm
Дослідження великих мовних моделей із застосуванням у фінансових завданнях

Один запуск агента звірив леджер із трьох рядків до 2958.50 USD на рахунку checking і 1958.50 USD вересневого прибутку, відновившись після збою, який він сам діагностував.

FinRAGBench-V: найкращі моделі сягають лише 20–61% recall цитат на рівні блоків на фінансових сторінках. Мультимодальний пошук випереджає текстовий майже на 50 пунктів.

Лише Qwen3.5-9B витримує 80% із 132 місяців CFO в EnterpriseArena, тоді як GPT-5.4 і DeepSeek-V3.1 дають 0%. Причина збоїв — пропущене звіряння реєстру.

WildToolBench: жодна LLM не перевищує 15% сесійної точності на 1 024 завданнях реальних користувачів, а найгостріші збої — прихований намір і переходи інструкцій.

Вербалізована впевненість GPT-4 сягає лише ~62,7% AUROC — ледь вище за випадковість. Фінансовим агентам з урахуванням невизначеності потрібне краще калібрування.

JSONSchemaBench: покриття падає з 86% на простих схемах до 3% на складних, тож структурований вивід LLM може непомітно давати невідповідний JSON.

FinMCP-Bench оцінює найкращу з шести LLM лише в 3,08% точного збігу на 613 реальних фінансових задачах MCP — 20-кратний обвал від одного інструмента до багатокроковості.

FinTrace показує: передові LLM обирають правильні фінансові інструменти (F1 ~0,9), але мають лише 3,23/5 за використання результатів — саме цей крок ламає агентів запису.

FinToolBench виявляє невідповідність намірів понад 50% у кожної протестованої LLM, тож агресивні виклики інструментів не дають кращих відповідей у фінансах.

OmniEval оцінює найкращі RAG-системи лише у 36% числової точності за 5 типами фінансових завдань, тож агентам для леджерів потрібна валідація перед записом проводок.

Таксономія NAACL 2025 залишається чинною, але табличні дані поза увагою. Командам фінансового AI доведеться самим адаптувати методи для vision-моделей.

Віднімання позиційного зсуву з ваг уваги LLM повертає до 15 пунктів точності RAG, коли доказ лежить у середині контексту, допомагаючи конвеєрам фінансових агентів.