
FinRAGBench-V: Multimodales RAG mit visuellen Zitaten im Finanzbereich
FinRAGBench-V zeigt: Top-Modelle erreichen nur 20–61 % Block-Level-Zitat-Recall auf Finanzseiten. Multimodales Retrieval schlägt Text-only um fast 50 Punkte.
#finance
Finanzforschung, Analyse und Domänenwissen für Buchhaltungs-KI

FinRAGBench-V zeigt: Top-Modelle erreichen nur 20–61 % Block-Level-Zitat-Recall auf Finanzseiten. Multimodales Retrieval schlägt Text-only um fast 50 Punkte.

Verbalisierte GPT-4-Konfidenz erreicht nur ~62,7 % AUROC, kaum über Zufall. Unsicherheitsbewusste Finanzagenten brauchen bessere Kalibrierung.

FinTrace zeigt: Frontier-LLMs wählen die richtigen Finanztools (F1 ~0,9), erreichen aber nur 3,23/5 bei deren Nutzung – der Schritt, der Write-Back-Agenten scheitern lässt.

OmniEval bewertet die besten RAG-Systeme mit 36% numerischer Genauigkeit über 5 Finanzaufgaben, daher brauchen Ledger-Agenten Validierung vor dem Buchen.

FinDERs 5.703 echte Analystenanfragen zeigen: Top-RAG ruft nur 25,95 % der 10-K-Belege ab. Erst Abkürzungen normalisieren, dann Embeddings wechseln.

LLMs schneiden bis zu 20 Punkte schlechter ab, wenn die Antwort in der Kontextmitte liegt, daher sollten Finanz-RAG-Pipelines die besten Passagen zuerst oder zuletzt setzen.

AnoLLM schlägt klassische Baselines bei gemischttypischen Betrugsdaten durch Zeilenbewertung mit LLM-Log-Likelihood, bringt aber bei rein numerischen Tabellen keinen Vorteil.

DocFinQA ersetzt FinQAs 700-Wort-Passagen durch vollständige SEC-Filings, einen 175× längeren Kontext, der die GPT-4-Genauigkeit bei langen Dokumenten fast halbiert.

TheAgentCompany bewertet 175 Unternehmensaufgaben in einem simulierten Intranet, und das beste Modell, Gemini-2.5-Pro, erledigt nur 30 % bei Kosten von 4 $ pro Aufgabe.

InvestorBench: Qwen2.5-72B führt beim Aktienhandel mit 46,15% CR; das auf Finanzen abgestimmte Palmyra-Fin schlägt bei Aktien fehl – Größe schlägt domänenspezifisches Feintuning.

Bei gleichen Denk-Token-Budgets erreichen oder übertreffen Single-Agent-LLMs Multi-Agent-Systeme bei Multi-Hop-Schlussfolgerungen – bevorzugen Sie einfachere Finanz-Agent-Designs.

M3MAD-Bench stellt fest, dass Collective Delusion 65% der Multi-Agenten-Debattenfehler verursacht, und adversariale Debatte senkt die Genauigkeit um bis zu 12,8%.