
FinRAGBench-V: мультимодальный RAG с визуальными цитатами в финансовой сфере
FinRAGBench-V: лучшие модели дают лишь 20–61% полноты цитирования на уровне блоков на финансовых страницах. Мультимодальный поиск лучше текстового почти на 50 пунктов.
#data-science
Методы науки о данных для финансовых наборов данных и бухгалтерских процессов

FinRAGBench-V: лучшие модели дают лишь 20–61% полноты цитирования на уровне блоков на финансовых страницах. Мультимодальный поиск лучше текстового почти на 50 пунктов.

WildToolBench обнаруживает, что ни одна LLM не превышает 15% точности сессий на 1 024 задачах реальных пользователей; скрытые намерения и смена инструкций — худшие сбои.

Вербализованная уверенность GPT-4 даёт лишь ~62,7% AUROC — едва выше случайности. Финансовым агентам нужна лучшая калибровка.

FinToolBench обнаруживает несоответствие намерений выше 50% у всех протестированных LLM, значит частое использование инструментов не даёт лучших ответов в финансах.

OmniEval оценивает лучшие RAG-системы в 36% числовой точности по 5 типам финансовых задач, поэтому агентам-регистраторам нужна валидация до записи проводок.

Таксономия NAACL 2025 работает, но охват таблиц отсутствует. Командам финансового ИИ придётся самим адаптировать методы визуальных моделей.

Вычитание позиционного смещения из весов внимания LLM возвращает до 15 пунктов точности RAG, когда доказательства в середине контекста, помогая конвейерам финансовых агентов.

Fin-RATE показывает, что точность LLM падает на 18,60% при лонгитюдном отслеживании, а узким местом является конвейер извлечения, а не модель.

На 5 703 реальных запросах аналитиков FinDER показывает, что лучший RAG находит лишь 25,95% доказательств из 10-K. Сначала нормализуйте сокращения, потом меняйте эмбеддинги.

LLM показывают до 20 баллов хуже, когда ответ стоит в середине контекста, поэтому финансовые RAG-конвейеры должны ставить лучшие пассажи в начало или конец.

AD-LLM обнаруживает, что GPT-4o достигает 0,93–0,99 AUROC в zero-shot для текстового обнаружения аномалий, но выбор модели LLM остаётся ненадёжным для ИИ финансового аудита.

CausalTAD переупорядочивает столбцы таблицы по причинной зависимости перед сериализацией для LLM, повышая средний AUC-ROC с 0,803 до 0,834 относительно AnoLLM.