
Prehľad detekcie anomálií pomocou LLM (NAACL 2025): Silná taxonómia, chýbajúce pokrytie tabuľkových dát
Taxonómia z NAACL 2025 platí, ale pokrytie tabuliek chýba. Tímy finančnej AI si musia metódy pre vizuálne modely prispôsobiť samy.
#analytics
Techniky dátovej analytiky a metriky pre finančné AI systémy

Taxonómia z NAACL 2025 platí, ale pokrytie tabuliek chýba. Tímy finančnej AI si musia metódy pre vizuálne modely prispôsobiť samy.

Fin-RATE ukazuje pokles presnosti LLM o 18,60 % pri longitudinálnom sledovaní, pričom úzkym miestom je retrieval pipeline, nie model.

LLM skórujú až o 20 bodov horšie, keď odpoveď leží uprostred kontextu, preto by finančné RAG pipeline mali umiestňovať najlepšie pasáže na začiatok alebo koniec.

AD-LLM zisťuje, že GPT-4o dosahuje 0,93–0,99 AUROC zero-shot pri detekcii textových anomálií, ale výber LLM modelu zostáva nespoľahlivý pre AI finančný audit.

τ-bench zisťuje, že špičkové LLM klesajú z pass@1 0,692 na pass@4 0,462 pri retail úlohách s nástrojmi. Agenti zapisujúci do ledgera čelia rovnakému útesu konzistencie.

Najlepší model ConvFinQA dosahuje 68,9 % presnosť vykonania oproti 89,4 % u ľudských expertov – medzera 21 bodov, ktorej čelí viacotočkový účtovný chat.

FinanceBench testuje 16 AI zostáv na 10 231 otázkach z podaní SEC: RAG so zdieľaným vektorovým úložiskom odpovie správne len v 19 %, takže vyhľadávanie nie je úzkym hrdlom.

Self-consistency hlasovaním väčšiny spomedzi mnohých vzorkovaných ciest uvažovania namiesto jedného greedy dekódovania pridáva 17,9 bodu na GSM8K bez dodatočného trénovania.