
FinRAGBench-V: Multimodale RAG met visuele citaten in het financiële domein
FinRAGBench-V vindt dat topmodellen slechts 20–61% block-level citatie-recall halen op financiële pagina's. Multimodale retrieval verslaat tekst-only met bijna 50 punten.
#machine-learning
Machine learning-technieken voor financiële data-analyse en automatisering

FinRAGBench-V vindt dat topmodellen slechts 20–61% block-level citatie-recall halen op financiële pagina's. Multimodale retrieval verslaat tekst-only met bijna 50 punten.

WildToolBench vindt geen LLM boven 15% sessienauwkeurigheid op 1.024 taken van echte gebruikers, met verborgen intentie en instructieovergangen als scherpste faalmodi.

Verbalized GPT-4-vertrouwen haalt slechts ~62,7% AUROC, nauwelijks boven toeval. Onzekerheidsbewuste finance-agenten hebben betere kalibratie nodig dan dat.

JSONSchemaBench vindt dat dekking instort van 86% bij eenvoudige schema's naar 3% bij complexe, dus LLM-gestructureerde output kan stilzwijgend niet-conforme JSON uitzenden.

FinMCP-Bench scoort de beste van zes LLM's op slechts 3,08% exacte match op 613 echte MCP-financiële taken, een 20×-instorting van single-tool naar multi-turn gebruik.

FinTrace toont dat frontier-LLM's de juiste financiële tools kiezen (F1 ~0,9) maar slechts 3,23/5 scoren op het gebruik van de resultaten, de stap die write-back-agents breekt.

FinToolBench vindt intentie-mismatch boven 50% bij elke geteste LLM, dus agressief tools aanroepen betekent niet betere antwoorden op financiële taken.

OmniEval scoort de beste RAG-systemen op 36% numerieke nauwkeurigheid over 5 financiële taaktypes, dus grootboek-agents hebben validatie nodig vóór het schrijven van boekingen.

De NAACL 2025-taxonomie houdt stand, maar tabeldekking ontbreekt. Finance-AI-teams moeten methoden voor vision-modellen zelf aanpassen.

Positiebias aftrekken van LLM-attentiegewichten herstelt tot 15 punten RAG-nauwkeurigheid wanneer bewijs midden in de context staat, wat finance-agent-pijplijnen helpt.

ReDAct stelt uit van een klein naar een groot model alleen wanneer perplexity onzekerheid signaleert: 64% lagere kosten bij gelijke nauwkeurigheid voor agents.

OpenHands' CodeAct-agent scoort 26% op SWE-Bench Lite en toont wat AI-agents vandaag betrouwbaar doen. Financie-automatisering moet nauw afgebakend beginnen, niet autonoom.