
FinRAGBench-V: мультимодальный RAG с визуальными цитатами в финансовой сфере
FinRAGBench-V: лучшие модели дают лишь 20–61% полноты цитирования на уровне блоков на финансовых страницах. Мультимодальный поиск лучше текстового почти на 50 пунктов.
#finance
Финансовые исследования, анализ и предметные знания для бухгалтерского ИИ

FinRAGBench-V: лучшие модели дают лишь 20–61% полноты цитирования на уровне блоков на финансовых страницах. Мультимодальный поиск лучше текстового почти на 50 пунктов.

Вербализованная уверенность GPT-4 даёт лишь ~62,7% AUROC — едва выше случайности. Финансовым агентам нужна лучшая калибровка.

FinTrace: передовые LLM выбирают нужные финансовые инструменты (F1 ~0,9), но получают лишь 3,23/5 за использование результатов — именно здесь ломаются агенты с записью.

OmniEval оценивает лучшие RAG-системы в 36% числовой точности по 5 типам финансовых задач, поэтому агентам-регистраторам нужна валидация до записи проводок.

На 5 703 реальных запросах аналитиков FinDER показывает, что лучший RAG находит лишь 25,95% доказательств из 10-K. Сначала нормализуйте сокращения, потом меняйте эмбеддинги.

LLM показывают до 20 баллов хуже, когда ответ стоит в середине контекста, поэтому финансовые RAG-конвейеры должны ставить лучшие пассажи в начало или конец.

AnoLLM превосходит классические методы на данных о мошенничестве смешанного типа, но не даёт преимуществ на чисто числовых таблицах.

DocFinQA заменяет 700-словные отрывки FinQA на полные отчёты SEC — контекст в 175 раз длиннее, что почти вдвое снижает точность GPT-4 на длинных документах.

TheAgentCompany тестирует 175 корпоративных задач в смоделированном интранете, и лучшая модель Gemini-2.5-Pro выполняет лишь 30% по $4 за каждую.

InvestorBench: Qwen2.5-72B лидирует в торговле акциями с CR 46,15%; финансово настроенная Palmyra-Fin дает обратный эффект на акциях — размер превосходит отраслевую тонкую настройку.

При равных бюджетах на токены мышления одностраничные LLM-агенты сравнимы или превосходят многоагентные системы в многошаговых рассуждениях — отдавайте предпочтение более простым конструкциям финансовых агентов.

M3MAD-Bench обнаруживает, что коллективная иллюзия вызывает 65% неудач дебатов мультиагентов, а состязательные дебаты снижают точность до 12.8%.