
FinRAGBench-V: Multimodale RAG met visuele citaten in het financiële domein
FinRAGBench-V vindt dat topmodellen slechts 20–61% block-level citatie-recall halen op financiële pagina's. Multimodale retrieval verslaat tekst-only met bijna 50 punten.
#financial-reporting
Genereren en auditen van financiële rapporten met taalmodellen

FinRAGBench-V vindt dat topmodellen slechts 20–61% block-level citatie-recall halen op financiële pagina's. Multimodale retrieval verslaat tekst-only met bijna 50 punten.

Fin-RATE toont dat LLM-nauwkeurigheid instort naar 18,60% bij longitudinale tracking, waarbij de retrieval-pijplijn, niet het model, de knellende bottleneck is.

FinDER's 5.703 echte analistenquery's tonen dat top-RAG slechts 25,95% van 10-K-bewijs terugvindt. Normaliseer eerst afkortingen, vóór het wisselen van embeddings.

DocFinQA vervangt FinQA's passages van 700 woorden door volledige SEC-documenten, een 175× langere context die GPT-4-nauwkeurigheid op lange documenten bijna halveert.

FinAuditing toont dat top-LLM's slechts 13,86% halen op financiële wiskundeverificatie van echte SEC XBRL-documenten, wat AI-boekhoudtools zelfstandig aankunnen.

TAT-LLM fine-tunet LLaMA 2 7B naar 64,60% EM op FinQA, net boven GPT-4's 63,91%: een extract-reason-execute-pijplijn laat een klein model tabelrekenwerk doen.

MultiHiertt toont dat modellen 38% F1 scoren tegen 87% voor mensen op 10.440 financiële QA-paren, met een daling van 15 punten bij vragen over meerdere tabellen.

Het beste model van ConvFinQA scoort 68,9% uitvoeringsnauwkeurigheid versus 89,4% voor menselijke experts—een kloof van 21 punten die multi-beurt grootboekchat nog steeds tegenkomt.

De hybride tabel-tekstvragen van TAT-QA toonden aan dat bewijsgrondslag, niet rekenwerk, de flessenhals is van finance-AI. Fijn afgestemde 7B-LLM's bereikten 83% F1 in 2024.

FinQA vond 61% voor neurale modellen op rekenwerk met financiële rapporten tegen 91% voor menselijke experts, dalend naar 22% bij drie of meer stappen.

FinanceBench test 16 AI-opstellingen op 10.231 echte SEC-documentvragen: RAG met gedeelde vector-store antwoordt slechts 19% correct, dus retrieval is niet de flessenhals.

PHANTOM (NeurIPS 2025) meet LLM-hallucinatiedetectie op echte SEC-filings. Qwen3-30B leidt met F1=0,882, maar 7B-modellen gokken bijna willekeurig.