
FinRAGBench-V: мультимодальный RAG с визуальными цитатами в финансовой сфере
FinRAGBench-V: лучшие модели дают лишь 20–61% полноты цитирования на уровне блоков на финансовых страницах. Мультимодальный поиск лучше текстового почти на 50 пунктов.
#machine-learning
Методы машинного обучения для анализа и автоматизации финансовых данных

FinRAGBench-V: лучшие модели дают лишь 20–61% полноты цитирования на уровне блоков на финансовых страницах. Мультимодальный поиск лучше текстового почти на 50 пунктов.

WildToolBench обнаруживает, что ни одна LLM не превышает 15% точности сессий на 1 024 задачах реальных пользователей; скрытые намерения и смена инструкций — худшие сбои.

Вербализованная уверенность GPT-4 даёт лишь ~62,7% AUROC — едва выше случайности. Финансовым агентам нужна лучшая калибровка.

JSONSchemaBench обнаруживает, что покрытие падает с 86% на простых схемах до 3% на сложных, поэтому структурный вывод LLM может незаметно выдавать несоответствующий JSON.

FinMCP-Bench: лучший из шести LLM даёт лишь 3,08% точных совпадений на 613 реальных финансовых задачах MCP — падение в 20 раз от одного инструмента к многошаговым.

FinTrace: передовые LLM выбирают нужные финансовые инструменты (F1 ~0,9), но получают лишь 3,23/5 за использование результатов — именно здесь ломаются агенты с записью.

FinToolBench обнаруживает несоответствие намерений выше 50% у всех протестированных LLM, значит частое использование инструментов не даёт лучших ответов в финансах.

OmniEval оценивает лучшие RAG-системы в 36% числовой точности по 5 типам финансовых задач, поэтому агентам-регистраторам нужна валидация до записи проводок.

Таксономия NAACL 2025 работает, но охват таблиц отсутствует. Командам финансового ИИ придётся самим адаптировать методы визуальных моделей.

Вычитание позиционного смещения из весов внимания LLM возвращает до 15 пунктов точности RAG, когда доказательства в середине контекста, помогая конвейерам финансовых агентов.

ReDAct переходит от малой модели к большой только когда перплексия сигнализирует о неопределённости, снижая затраты на 64% при той же точности для рабочих процессов агентов.

Агент CodeAct от OpenHands набирает 26% на SWE-Bench Lite, показывая, что ИИ-агенты умеют надёжно сегодня. Автоматизацию финансов стоит начинать узко, а не автономно.