
FinRAGBench-V: Multimodale RAG met visuele citaten in het financiële domein
FinRAGBench-V vindt dat topmodellen slechts 20–61% block-level citatie-recall halen op financiële pagina's. Multimodale retrieval verslaat tekst-only met bijna 50 punten.
#data-science
Data science-methoden toegepast op financiële datasets en accountingworkflows

FinRAGBench-V vindt dat topmodellen slechts 20–61% block-level citatie-recall halen op financiële pagina's. Multimodale retrieval verslaat tekst-only met bijna 50 punten.

WildToolBench vindt geen LLM boven 15% sessienauwkeurigheid op 1.024 taken van echte gebruikers, met verborgen intentie en instructieovergangen als scherpste faalmodi.

Verbalized GPT-4-vertrouwen haalt slechts ~62,7% AUROC, nauwelijks boven toeval. Onzekerheidsbewuste finance-agenten hebben betere kalibratie nodig dan dat.

FinToolBench vindt intentie-mismatch boven 50% bij elke geteste LLM, dus agressief tools aanroepen betekent niet betere antwoorden op financiële taken.

OmniEval scoort de beste RAG-systemen op 36% numerieke nauwkeurigheid over 5 financiële taaktypes, dus grootboek-agents hebben validatie nodig vóór het schrijven van boekingen.

De NAACL 2025-taxonomie houdt stand, maar tabeldekking ontbreekt. Finance-AI-teams moeten methoden voor vision-modellen zelf aanpassen.

Positiebias aftrekken van LLM-attentiegewichten herstelt tot 15 punten RAG-nauwkeurigheid wanneer bewijs midden in de context staat, wat finance-agent-pijplijnen helpt.

Fin-RATE toont dat LLM-nauwkeurigheid instort naar 18,60% bij longitudinale tracking, waarbij de retrieval-pijplijn, niet het model, de knellende bottleneck is.

FinDER's 5.703 echte analistenquery's tonen dat top-RAG slechts 25,95% van 10-K-bewijs terugvindt. Normaliseer eerst afkortingen, vóór het wisselen van embeddings.

LLM's scoren tot 20 punten slechter wanneer het antwoord middenin de context staat, dus finance-RAG-pipelines plaatsen beste passages eerst of laatst.

AD-LLM vindt dat GPT-4o 0,93–0,99 AUROC zero-shot haalt voor tekstuele anomaliedetectie, maar LLM-modelselectie blijft onbetrouwbaar voor financiële audit-AI.

CausalTAD herordent tabelkolommen op causale afhankelijkheid vóór LLM-serialisatie, en verhoogt gemiddelde AUC-ROC van 0,803 naar 0,834 boven AnoLLM.