
FinRAGBench-V: Multimodales RAG mit visuellen Zitaten im Finanzbereich
FinRAGBench-V zeigt: Top-Modelle erreichen nur 20–61 % Block-Level-Zitat-Recall auf Finanzseiten. Multimodales Retrieval schlägt Text-only um fast 50 Punkte.
#data-science
Datenwissenschaftliche Methoden für Finanzdatensätze und Buchhaltungs-Workflows

FinRAGBench-V zeigt: Top-Modelle erreichen nur 20–61 % Block-Level-Zitat-Recall auf Finanzseiten. Multimodales Retrieval schlägt Text-only um fast 50 Punkte.

WildToolBench findet kein LLM über 15 % Sitzungsgenauigkeit bei 1.024 Echtnutzer-Aufgaben, verborgene Intention und Instruktionswechsel sind die schärfsten Fehlermodi.

Verbalisierte GPT-4-Konfidenz erreicht nur ~62,7 % AUROC, kaum über Zufall. Unsicherheitsbewusste Finanzagenten brauchen bessere Kalibrierung.

FinToolBench findet Intent-Mismatch über 50% bei jedem getesteten LLM, aggressives Tool-Calling bedeutet also nicht bessere Antworten bei Finanzaufgaben.

OmniEval bewertet die besten RAG-Systeme mit 36% numerischer Genauigkeit über 5 Finanzaufgaben, daher brauchen Ledger-Agenten Validierung vor dem Buchen.

Die NAACL-2025-Taxonomie bleibt gültig, doch tabellarische Abdeckung fehlt. Finanz-KI-Teams müssen Vision-Modell-Methoden selbst anpassen.

Das Subtrahieren von Positions-Bias aus LLM-Attention-Gewichten gewinnt bis zu 15 Punkte RAG-Genauigkeit, wenn Belege mitten im Kontext liegen.

Fin-RATE zeigt: LLM-Genauigkeit bricht auf 18,60 % bei longitudinaler Verfolgung ein, wobei die Retrieval-Pipeline, nicht das Modell, der Engpass ist.

FinDERs 5.703 echte Analystenanfragen zeigen: Top-RAG ruft nur 25,95 % der 10-K-Belege ab. Erst Abkürzungen normalisieren, dann Embeddings wechseln.

LLMs schneiden bis zu 20 Punkte schlechter ab, wenn die Antwort in der Kontextmitte liegt, daher sollten Finanz-RAG-Pipelines die besten Passagen zuerst oder zuletzt setzen.

AD-LLM zeigt, dass GPT-4o Zero-Shot 0,93–0,99 AUROC bei der Text-Anomalieerkennung erreicht, doch die LLM-Modellauswahl für KI-Finanzprüfung bleibt unzuverlässig.

CausalTAD ordnet Tabellenspalten vor der LLM-Serialisierung nach kausaler Abhängigkeit um und hebt den mittleren AUC-ROC gegenüber AnoLLM von 0,803 auf 0,834.