
FinRAGBench-V: Multimodálny RAG s vizuálnymi citáciami vo finančnej oblasti
FinRAGBench-V zisťuje, že špičkové modely dosahujú len 20 – 61 % citovania blokov na finančných stránkach. Multimodálne vyhľadávanie prekonáva textové o takmer 50 bodov.
#finance
Finančný výskum, analýza a doménové znalosti pre účtovnú AI

FinRAGBench-V zisťuje, že špičkové modely dosahujú len 20 – 61 % citovania blokov na finančných stránkach. Multimodálne vyhľadávanie prekonáva textové o takmer 50 bodov.

Verbalizovaná dôvera GPT-4 dosahuje len ~62,7 % AUROC, sotva nad úrovňou náhody. Finanční agenti vnímajúci neistotu potrebujú lepšiu kalibráciu.

FinTrace ukazuje, že špičkové LLM vyberú správne finančné nástroje (F1 ~0,9), ale v použití výsledkov dosahujú len 3,23/5, čo je krok, ktorý láme agentov zapisujúcich späť.

OmniEval hodnotí najlepšie RAG systémy na 36 % numerickej presnosti v 5 typoch finančných úloh, takže agenti pre hlavnú knihu potrebujú validáciu pred zápisom položiek.

5 703 reálnych analytických dopytov vo FinDER ukazuje, že špičkový RAG vyhľadá len 25,95 % dôkazov z 10-K. Najprv normalizujte skratky, až potom meňte embeddingy.

LLM skórujú až o 20 bodov horšie, keď odpoveď leží uprostred kontextu, preto by finančné RAG pipeline mali umiestňovať najlepšie pasáže na začiatok alebo koniec.

AnoLLM prekonáva klasické baseline na zmiešaných podvodných dátach skórovaním riadkov negatívnou log-pravdepodobnosťou LLM, no na čisto numerických tabuľkách neprináša výhodu.

DocFinQA nahrádza 700-slovné pasáže FinQA plnými podaniami SEC — 175× dlhší kontext, ktorý takmer polovuje presnosť GPT-4 na dlhých dokumentoch.

TheAgentCompany benchmarkuje 175 podnikových úloh v simulovanom intranete a najlepší model Gemini-2.5-Pro dokončí len 30 % za 4 $ za úlohu.

InvestorBench: Qwen2.5-72B vedie obchodovanie s akciami s 46,15% CR; finančne vyladený Palmyra-Fin zlyháva na akciách – veľkosť prekonáva doménové doladenie.

Pri rovnakých rozpočtoch myšlienkových tokenov dosahujú single-agent LLM rovnaké alebo lepšie výsledky ako multi-agent systémy pri viacstupňovom uvažovaní — uprednostnite jednoduchšie návrhy finančných agentov.

M3MAD-Bench zisťuje, že Collective Delusion spôsobuje 65 % zlyhaní debát viacerých agentov a adversariálna debata znižuje presnosť až o 12,8 %.