
FinRAGBench-V: Multimodálny RAG s vizuálnymi citáciami vo finančnej oblasti
FinRAGBench-V zisťuje, že špičkové modely dosahujú len 20 – 61 % citovania blokov na finančných stránkach. Multimodálne vyhľadávanie prekonáva textové o takmer 50 bodov.
#data-science
Metódy dátovej vedy aplikované na finančné datasety a účtovné pracovné postupy

FinRAGBench-V zisťuje, že špičkové modely dosahujú len 20 – 61 % citovania blokov na finančných stránkach. Multimodálne vyhľadávanie prekonáva textové o takmer 50 bodov.

WildToolBench: žiadne LLM neprekročí 15 % presnosti relácie na 1 024 úlohách reálnych používateľov, pričom skrytý zámer a prechody inštrukcií sú najostrejšie zlyhania.

Verbalizovaná dôvera GPT-4 dosahuje len ~62,7 % AUROC, sotva nad úrovňou náhody. Finanční agenti vnímajúci neistotu potrebujú lepšiu kalibráciu.

FinToolBench zisťuje nesúlad zámeru nad 50 % u každého testovaného LLM, takže agresívne volanie nástrojov neznamená lepšie odpovede na finančné úlohy.

OmniEval hodnotí najlepšie RAG systémy na 36 % numerickej presnosti v 5 typoch finančných úloh, takže agenti pre hlavnú knihu potrebujú validáciu pred zápisom položiek.

Taxonómia z NAACL 2025 platí, ale pokrytie tabuliek chýba. Tímy finančnej AI si musia metódy pre vizuálne modely prispôsobiť samy.

Odčítanie pozičnej odchýlky z váh pozornosti LLM obnoví až 15 bodov presnosti RAG, keď dôkaz leží uprostred kontextu, čo pomáha pipeline finančných agentov.

Fin-RATE ukazuje pokles presnosti LLM o 18,60 % pri longitudinálnom sledovaní, pričom úzkym miestom je retrieval pipeline, nie model.

5 703 reálnych analytických dopytov vo FinDER ukazuje, že špičkový RAG vyhľadá len 25,95 % dôkazov z 10-K. Najprv normalizujte skratky, až potom meňte embeddingy.

LLM skórujú až o 20 bodov horšie, keď odpoveď leží uprostred kontextu, preto by finančné RAG pipeline mali umiestňovať najlepšie pasáže na začiatok alebo koniec.

AD-LLM zisťuje, že GPT-4o dosahuje 0,93–0,99 AUROC zero-shot pri detekcii textových anomálií, ale výber LLM modelu zostáva nespoľahlivý pre AI finančný audit.

CausalTAD preusporiada stĺpce tabuľky podľa kauzálnej závislosti pred serializáciou do LLM, čím zvýši priemerné AUC-ROC z 0,803 na 0,834 oproti AnoLLM.