
LLM-Anomalieerkennung Survey (NAACL 2025): Starke Taxonomie, fehlende Abdeckung tabellarischer Daten
Die NAACL-2025-Taxonomie bleibt gültig, doch tabellarische Abdeckung fehlt. Finanz-KI-Teams müssen Vision-Modell-Methoden selbst anpassen.
#analytics
Datenanalyse-Techniken und Metriken für finanzielle KI-Systeme

Die NAACL-2025-Taxonomie bleibt gültig, doch tabellarische Abdeckung fehlt. Finanz-KI-Teams müssen Vision-Modell-Methoden selbst anpassen.

Fin-RATE zeigt: LLM-Genauigkeit bricht auf 18,60 % bei longitudinaler Verfolgung ein, wobei die Retrieval-Pipeline, nicht das Modell, der Engpass ist.

LLMs schneiden bis zu 20 Punkte schlechter ab, wenn die Antwort in der Kontextmitte liegt, daher sollten Finanz-RAG-Pipelines die besten Passagen zuerst oder zuletzt setzen.

AD-LLM zeigt, dass GPT-4o Zero-Shot 0,93–0,99 AUROC bei der Text-Anomalieerkennung erreicht, doch die LLM-Modellauswahl für KI-Finanzprüfung bleibt unzuverlässig.

τ-bench findet: Top-LLMs fallen von pass@1 0,692 auf pass@4 0,462 bei Retail-Tool-Aufgaben. Zurückschreibende Ledger-Agenten stehen vor derselben Konsistenzklippe.

Das beste Modell von ConvFinQA erreicht 68,9% Ausführungsgenauigkeit gegenüber 89,4% bei menschlichen Experten – eine Lücke von 21 Punkten, die der mehrstufige Ledger-Chat weiterhin bewältigen muss.

FinanceBench testet 16 KI-Ansätze an 10.231 echten SEC-Filing-Fragen: Shared-Vector-Store-RAG antwortet nur zu 19 % richtig – Retrieval ist nicht der Engpass.

Self-Consistency bildet die Mehrheitswahl über viele Stichproben-Reasoning-Pfade statt eines gierigen Dekodierens und bringt +17,9 Punkte auf GSM8K ohne zusätzliches Training.