
FinRAGBench-V: Мультимодальний RAG із візуальним цитуванням у фінансовій сфері
FinRAGBench-V: найкращі моделі сягають лише 20–61% recall цитат на рівні блоків на фінансових сторінках. Мультимодальний пошук випереджає текстовий майже на 50 пунктів.
#financial-reporting
Генерування та аудит фінансових звітів за допомогою мовних моделей

FinRAGBench-V: найкращі моделі сягають лише 20–61% recall цитат на рівні блоків на фінансових сторінках. Мультимодальний пошук випереджає текстовий майже на 50 пунктів.

Fin-RATE показує, що точність LLM обвалюється на 18,60% під час лонгітюдного відстеження, а вузьким місцем є конвеєр пошуку, а не модель.

5 703 реальні запити аналітиків у FinDER показують: найкращий RAG відтворює лише 25,95% доказів із 10-K. Спершу нормалізуйте абревіатури, а вже потім міняйте ембединги.

DocFinQA замінює 700-слівні уривки FinQA на повні звіти SEC — у 175 разів довший контекст, що майже вдвічі знижує точність GPT-4 на довгих документах.

FinAuditing shows top LLMs hit just 13.86% on financial math verification of real SEC XBRL filings, capping what AI accounting tools can automate unaided.

TAT-LLM дообучує LLaMA 2 7B до 64,60% EM на FinQA, трохи випереджаючи 63,91% у GPT-4: конвеєр видобути-міркувати-виконати дає малій моделі змогу рахувати таблиці.

MultiHiertt показує, що моделі набирають 38% F1 проти 87% у людей на 10,440 фінансових QA-парах, з падінням на 15 пунктів на питаннях між таблицями.

Найкраща модель ConvFinQA досягає 68.9% точності виконання проти 89.4% у людей-експертів — розрив у 21 пункт, який досі актуальний для багатоходового чату з бухгалтерською книгою.

Гібридні таблично-текстові питання TAT-QA показали, що вузьким місцем фінансового ШІ є прив'язка до доказів, а не арифметика. Доопрацьовані 7B LLM сягнули 83% F1 до 2024 року.

FinQA виявив, що нейромережі набрали 61% у математиці за фінансовими звітами проти 91% у людей-експертів, падаючи до 22% на програмах із трьох і більше кроків.

FinanceBench тестує 16 AI-конфігурацій на 10 231 реальному питанні до звітів SEC: RAG зі спільним векторним сховищем дає лише 19% правильних, тож пошук не є вузьким місцем.

PHANTOM (NeurIPS 2025) вимірює виявлення галюцинацій LLM на реальних звітах SEC. Qwen3-30B лідирує з F1=0.882, але моделі 7B вгадують майже випадково.