
Сможет ли ваш агент свести эти книги?
Один прогон агента свёл регистр из трёх строк к 2958.50 USD на расчётном счёте и 1958.50 USD сентябрьской прибыли, восстановившись после сбоя, который он сам диагностировал.
#llm
Исследования больших языковых моделей с применением в финансовых задачах

Один прогон агента свёл регистр из трёх строк к 2958.50 USD на расчётном счёте и 1958.50 USD сентябрьской прибыли, восстановившись после сбоя, который он сам диагностировал.

FinRAGBench-V: лучшие модели дают лишь 20–61% полноты цитирования на уровне блоков на финансовых страницах. Мультимодальный поиск лучше текстового почти на 50 пунктов.

Только Qwen3.5-9B выдерживает 80% из 132-месячных прогонов CFO в EnterpriseArena, а GPT-5.4 и DeepSeek-V3.1 достигают 0%. Причина сбоев — пропущенная сверка регистра.

WildToolBench обнаруживает, что ни одна LLM не превышает 15% точности сессий на 1 024 задачах реальных пользователей; скрытые намерения и смена инструкций — худшие сбои.

Вербализованная уверенность GPT-4 даёт лишь ~62,7% AUROC — едва выше случайности. Финансовым агентам нужна лучшая калибровка.

JSONSchemaBench обнаруживает, что покрытие падает с 86% на простых схемах до 3% на сложных, поэтому структурный вывод LLM может незаметно выдавать несоответствующий JSON.

FinMCP-Bench: лучший из шести LLM даёт лишь 3,08% точных совпадений на 613 реальных финансовых задачах MCP — падение в 20 раз от одного инструмента к многошаговым.

FinTrace: передовые LLM выбирают нужные финансовые инструменты (F1 ~0,9), но получают лишь 3,23/5 за использование результатов — именно здесь ломаются агенты с записью.

FinToolBench обнаруживает несоответствие намерений выше 50% у всех протестированных LLM, значит частое использование инструментов не даёт лучших ответов в финансах.

OmniEval оценивает лучшие RAG-системы в 36% числовой точности по 5 типам финансовых задач, поэтому агентам-регистраторам нужна валидация до записи проводок.

Таксономия NAACL 2025 работает, но охват таблиц отсутствует. Командам финансового ИИ придётся самим адаптировать методы визуальных моделей.

Вычитание позиционного смещения из весов внимания LLM возвращает до 15 пунктов точности RAG, когда доказательства в середине контекста, помогая конвейерам финансовых агентов.