
FinRAGBench-V: мультимодальный RAG с визуальными цитатами в финансовой сфере
FinRAGBench-V: лучшие модели дают лишь 20–61% полноты цитирования на уровне блоков на финансовых страницах. Мультимодальный поиск лучше текстового почти на 50 пунктов.
#financial-reporting
Генерация и аудит финансовой отчётности с помощью языковых моделей

FinRAGBench-V: лучшие модели дают лишь 20–61% полноты цитирования на уровне блоков на финансовых страницах. Мультимодальный поиск лучше текстового почти на 50 пунктов.

Fin-RATE показывает, что точность LLM падает на 18,60% при лонгитюдном отслеживании, а узким местом является конвейер извлечения, а не модель.

На 5 703 реальных запросах аналитиков FinDER показывает, что лучший RAG находит лишь 25,95% доказательств из 10-K. Сначала нормализуйте сокращения, потом меняйте эмбеддинги.

DocFinQA заменяет 700-словные отрывки FinQA на полные отчёты SEC — контекст в 175 раз длиннее, что почти вдвое снижает точность GPT-4 на длинных документах.

FinAuditing shows top LLMs hit just 13.86% on financial math verification of real SEC XBRL filings, capping what AI accounting tools can automate unaided.

TAT-LLM дообучает LLaMA 2 7B до 64,60% EM на FinQA, чуть обходя GPT-4 с 63,91%: конвейер извлечь-рассудить-вычислить даёт малой модели табличную арифметику.

MultiHiertt показывает, что модели набирают 38% F1 против 87% у людей на 10,440 парах финансовых вопросов, с падением на 15 баллов на межтабличных вопросах.

Лучшая модель ConvFinQA достигает 68,9% точности выполнения против 89,4% у экспертов-людей — разрыв в 21 пункт, который многопоточный чат по бухгалтерии всё ещё преодолевает.

Гибридные вопросы таблиц и текста в TAT-QA показали, что узкое место финансового ИИ — привязка к данным, а не арифметика. Дообученные LLM 7B достигли 83% F1 к 2024 году.

FinQA выявил, что нейросети набрали 61% на математике по финансовым отчётам против 91% у экспертов, падая до 22% на программах из трёх и более шагов.

FinanceBench тестирует 16 конфигураций ИИ на 10 231 вопросе по отчётам SEC: RAG с общим векторным хранилищем даёт лишь 19% верных ответов, значит поиск — не узкое место.

PHANTOM (NeurIPS 2025) измеряет обнаружение галлюцинаций LLM на реальных отчётах SEC. Qwen3-30B лидирует с F1=0,882, но модели на 7B угадывают почти случайно.