
FinRAGBench-V: Multimodales RAG mit visuellen Zitaten im Finanzbereich
FinRAGBench-V zeigt: Top-Modelle erreichen nur 20–61 % Block-Level-Zitat-Recall auf Finanzseiten. Multimodales Retrieval schlägt Text-only um fast 50 Punkte.
#financial-reporting
Erstellung und Prüfung von Finanzberichten mit Sprachmodellen

FinRAGBench-V zeigt: Top-Modelle erreichen nur 20–61 % Block-Level-Zitat-Recall auf Finanzseiten. Multimodales Retrieval schlägt Text-only um fast 50 Punkte.

Fin-RATE zeigt: LLM-Genauigkeit bricht auf 18,60 % bei longitudinaler Verfolgung ein, wobei die Retrieval-Pipeline, nicht das Modell, der Engpass ist.

FinDERs 5.703 echte Analystenanfragen zeigen: Top-RAG ruft nur 25,95 % der 10-K-Belege ab. Erst Abkürzungen normalisieren, dann Embeddings wechseln.

DocFinQA ersetzt FinQAs 700-Wort-Passagen durch vollständige SEC-Filings, einen 175× längeren Kontext, der die GPT-4-Genauigkeit bei langen Dokumenten fast halbiert.

FinAuditing zeigt: Top-LLMs erreichen nur 13,86% bei der Finanzmathematik-Prüfung echter SEC-XBRL-Einreichungen und begrenzen so die KI-Buchhaltung ohne Hilfe.

TAT-LLM erreicht mit LLaMA 2 7B 64,60 % EM bei FinQA und übertrifft GPT-4 (63,91 %): Eine Extract-Reason-Execute-Pipeline bringt Tabellenarithmetik in kleine Modelle.

MultiHiertt zeigt: Modelle erreichen 38% F1 gegenüber 87% bei Menschen auf 10.440 Finanz-QA-Paaren, mit 15 Punkten Rückgang bei tabellenübergreifenden Fragen.

Das beste Modell von ConvFinQA erreicht 68,9% Ausführungsgenauigkeit gegenüber 89,4% bei menschlichen Experten – eine Lücke von 21 Punkten, die der mehrstufige Ledger-Chat weiterhin bewältigen muss.

TAT-QAs hybride Tabellen-Text-Fragen zeigten, dass Evidenzbindung, nicht Arithmetik, der Engpass der Finanz-KI ist. Feingetunte 7B-LLMs erreichten bis 2024 83% F1.

FinQA fand: Neuronale Modelle erreichten 61% bei Finanzberichts-Mathematik gegenüber 91% bei menschlichen Experten, mit Einbruch auf 22% bei Programmen ab drei Schritten.

FinanceBench testet 16 KI-Ansätze an 10.231 echten SEC-Filing-Fragen: Shared-Vector-Store-RAG antwortet nur zu 19 % richtig – Retrieval ist nicht der Engpass.

PHANTOM (NeurIPS 2025) misst die LLM-Halluzinationserkennung an echten SEC-Filings. Qwen3-30B führt mit F1=0.882, doch 7B-Modelle raten nahezu zufällig.