
LLM Anomaly Detection Survey (NAACL 2025): Sterke Taxonomie, Ontbrekende Tabeldekking
De NAACL 2025-taxonomie houdt stand, maar tabeldekking ontbreekt. Finance-AI-teams moeten methoden voor vision-modellen zelf aanpassen.
#analytics
Data-analyse-technieken en metrieken voor financiële AI-systemen

De NAACL 2025-taxonomie houdt stand, maar tabeldekking ontbreekt. Finance-AI-teams moeten methoden voor vision-modellen zelf aanpassen.

Fin-RATE toont dat LLM-nauwkeurigheid instort naar 18,60% bij longitudinale tracking, waarbij de retrieval-pijplijn, niet het model, de knellende bottleneck is.

LLM's scoren tot 20 punten slechter wanneer het antwoord middenin de context staat, dus finance-RAG-pipelines plaatsen beste passages eerst of laatst.

AD-LLM vindt dat GPT-4o 0,93–0,99 AUROC zero-shot haalt voor tekstuele anomaliedetectie, maar LLM-modelselectie blijft onbetrouwbaar voor financiële audit-AI.

τ-bench vindt dat top-LLM's dalen van pass@1 0,692 naar pass@4 0,462 op retail-tool-taken. Write-back-agents op een grootboek staan voor dezelfde consistentieklif.

Het beste model van ConvFinQA scoort 68,9% uitvoeringsnauwkeurigheid versus 89,4% voor menselijke experts—een kloof van 21 punten die multi-beurt grootboekchat nog steeds tegenkomt.

FinanceBench test 16 AI-opstellingen op 10.231 echte SEC-documentvragen: RAG met gedeelde vector-store antwoordt slechts 19% correct, dus retrieval is niet de flessenhals.

Self-consistency laat vele gesamplede redeneerpaden per meerderheidsstemming beslissen in plaats van één greedy decode, wat 17,9 punten toevoegt op GSM8K zonder extra training.