
FinRAGBench-V: Multimodálny RAG s vizuálnymi citáciami vo finančnej oblasti
FinRAGBench-V zisťuje, že špičkové modely dosahujú len 20 – 61 % citovania blokov na finančných stránkach. Multimodálne vyhľadávanie prekonáva textové o takmer 50 bodov.
#financial-reporting
Generovanie a audit finančných správ s jazykovými modelmi

FinRAGBench-V zisťuje, že špičkové modely dosahujú len 20 – 61 % citovania blokov na finančných stránkach. Multimodálne vyhľadávanie prekonáva textové o takmer 50 bodov.

Fin-RATE ukazuje pokles presnosti LLM o 18,60 % pri longitudinálnom sledovaní, pričom úzkym miestom je retrieval pipeline, nie model.

5 703 reálnych analytických dopytov vo FinDER ukazuje, že špičkový RAG vyhľadá len 25,95 % dôkazov z 10-K. Najprv normalizujte skratky, až potom meňte embeddingy.

DocFinQA nahrádza 700-slovné pasáže FinQA plnými podaniami SEC — 175× dlhší kontext, ktorý takmer polovuje presnosť GPT-4 na dlhých dokumentoch.

FinAuditing ukazuje, že špičkové LLM dosahujú len 13,86 % pri overovaní finančnej matematiky podaní SEC XBRL, čo obmedzuje automatizáciu AI účtovných nástrojov.

TAT-LLM doladí LLaMA 2 7B na 64,60 % EM vo FinQA, čím tesne predbehne GPT-4 s 63,91 %: pipeline extrahuj-odôvodni-vykonaj umožní malému modelu robiť tabuľkovú aritmetiku.

MultiHiertt ukazuje, že modely dosahujú 38 % F1 oproti 87 % u ľudí na 10 440 finančných QA pároch, s poklesom o 15 bodov pri otázkach naprieč tabuľkami.

Najlepší model ConvFinQA dosahuje 68,9 % presnosť vykonania oproti 89,4 % u ľudských expertov – medzera 21 bodov, ktorej čelí viacotočkový účtovný chat.

Hybridné otázky tabuliek a textu v TAT-QA ukázali, že úzkym hrdlom finančnej AI je ukotvenie dôkazov, nie aritmetika. Doladené 7B LLM dosiahli do roku 2024 83 % F1.

FinQA zistila, že neurónové modely dosiahli 61 % v matematike finančných správ oproti 91 % u ľudských expertov, pri programoch s tromi a viac krokmi klesli na 22 %.

FinanceBench testuje 16 AI zostáv na 10 231 otázkach z podaní SEC: RAG so zdieľaným vektorovým úložiskom odpovie správne len v 19 %, takže vyhľadávanie nie je úzkym hrdlom.

PHANTOM (NeurIPS 2025) meria detekciu halucinácií LLM na reálnych SEC podaniach. Qwen3-30B vedie s F1=0,882, no modely s 7B hádajú takmer náhodne.