
FinRAGBench-V: Multimodale RAG met visuele citaten in het financiële domein
FinRAGBench-V vindt dat topmodellen slechts 20–61% block-level citatie-recall halen op financiële pagina's. Multimodale retrieval verslaat tekst-only met bijna 50 punten.
#finance
Financieel onderzoek, analyse en domeinkennis voor accounting-AI

FinRAGBench-V vindt dat topmodellen slechts 20–61% block-level citatie-recall halen op financiële pagina's. Multimodale retrieval verslaat tekst-only met bijna 50 punten.

Verbalized GPT-4-vertrouwen haalt slechts ~62,7% AUROC, nauwelijks boven toeval. Onzekerheidsbewuste finance-agenten hebben betere kalibratie nodig dan dat.

FinTrace toont dat frontier-LLM's de juiste financiële tools kiezen (F1 ~0,9) maar slechts 3,23/5 scoren op het gebruik van de resultaten, de stap die write-back-agents breekt.

OmniEval scoort de beste RAG-systemen op 36% numerieke nauwkeurigheid over 5 financiële taaktypes, dus grootboek-agents hebben validatie nodig vóór het schrijven van boekingen.

FinDER's 5.703 echte analistenquery's tonen dat top-RAG slechts 25,95% van 10-K-bewijs terugvindt. Normaliseer eerst afkortingen, vóór het wisselen van embeddings.

LLM's scoren tot 20 punten slechter wanneer het antwoord middenin de context staat, dus finance-RAG-pipelines plaatsen beste passages eerst of laatst.

AnoLLM verslaat klassieke baselines op fraudedata met gemengde types door rijen te scoren met LLM negative log-likelihood, maar biedt geen voordeel op puur numerieke tabellen.

DocFinQA vervangt FinQA's passages van 700 woorden door volledige SEC-documenten, een 175× langere context die GPT-4-nauwkeurigheid op lange documenten bijna halveert.

TheAgentCompany benchmarkt 175 bedrijfstaken in een gesimuleerd intranet, en het beste model, Gemini-2.5-Pro, voltooit slechts 30% voor $4 per stuk.

InvestorBench: Qwen2.5-72B leidt in aandelenhandel met 46,15% CR; op financiën afgestemde Palmyra-Fin werkt averechts op aandelen—grootte verslaat domein-finetuning.

Bij gelijke budgets voor denk-tokens presteren single-agent LLM's even goed als of beter dan multi-agent-systemen bij multi-hop-redenering—kies voor eenvoudigere financiële agentontwerpen.

M3MAD-Bench stelt vast dat Collective Delusion 65% van de mislukkingen bij multi-agent-debat veroorzaakt, en adversarieel debat verlaagt de nauwkeurigheid met tot 12,8%.