
FinRAGBench-V: Multimodales RAG mit visuellen Zitaten im Finanzbereich
FinRAGBench-V zeigt: Top-Modelle erreichen nur 20–61 % Block-Level-Zitat-Recall auf Finanzseiten. Multimodales Retrieval schlägt Text-only um fast 50 Punkte.
#ai
Forschung und Anwendungen künstlicher Intelligenz in Finanzwesen und Buchhaltung

FinRAGBench-V zeigt: Top-Modelle erreichen nur 20–61 % Block-Level-Zitat-Recall auf Finanzseiten. Multimodales Retrieval schlägt Text-only um fast 50 Punkte.

Nur Qwen3.5-9B übersteht 80% der 132-Monats-CFO-Läufe von EnterpriseArena, während GPT-5.4 und DeepSeek-V3.1 0% erreichen. Übersprungener Ledger-Abgleich verursacht die Fehler.

WildToolBench findet kein LLM über 15 % Sitzungsgenauigkeit bei 1.024 Echtnutzer-Aufgaben, verborgene Intention und Instruktionswechsel sind die schärfsten Fehlermodi.

Verbalisierte GPT-4-Konfidenz erreicht nur ~62,7 % AUROC, kaum über Zufall. Unsicherheitsbewusste Finanzagenten brauchen bessere Kalibrierung.

JSONSchemaBench findet, dass die Abdeckung von 86% bei einfachen Schemas auf 3% bei komplexen fällt, daher kann strukturierte LLM-Ausgabe still nicht-konformes JSON liefern.

FinMCP-Bench bewertet das beste von sechs LLMs mit nur 3,08 % Exact Match bei 613 echten MCP-Finanzaufgaben, ein 20-facher Einbruch von Single-Tool zu Multi-Turn.

FinTrace zeigt: Frontier-LLMs wählen die richtigen Finanztools (F1 ~0,9), erreichen aber nur 3,23/5 bei deren Nutzung – der Schritt, der Write-Back-Agenten scheitern lässt.

FinToolBench findet Intent-Mismatch über 50% bei jedem getesteten LLM, aggressives Tool-Calling bedeutet also nicht bessere Antworten bei Finanzaufgaben.

OmniEval bewertet die besten RAG-Systeme mit 36% numerischer Genauigkeit über 5 Finanzaufgaben, daher brauchen Ledger-Agenten Validierung vor dem Buchen.

Die NAACL-2025-Taxonomie bleibt gültig, doch tabellarische Abdeckung fehlt. Finanz-KI-Teams müssen Vision-Modell-Methoden selbst anpassen.

Das Subtrahieren von Positions-Bias aus LLM-Attention-Gewichten gewinnt bis zu 15 Punkte RAG-Genauigkeit, wenn Belege mitten im Kontext liegen.

ReDAct wechselt vom kleinen zum großen Modell nur, wenn Perplexität Unsicherheit signalisiert – 64% Kostenersparnis bei gleicher Genauigkeit für Agenten-Workflows.