Preskočiť na hlavný obsah

#analytics

Analytics

Data analytics techniques and metrics for financial AI systems

FinanceBench: Prečo RAG s vektorovým úložiskom zlyháva pri reálnych finančných dokumentoch

FinanceBench vyhodnocuje 16 konfigurácií AI voči 10 231 otázkam z reálnych výkazov SEC; RAG so zdieľaným vektorovým úložiskom odpovedá správne len v 19 % prípadov a dokonca aj GPT-4-Turbo s ideálnym textovým úryvkom (oracle passage) dosahuje len 85 % presnosť — čo ukazuje, že numerické uvažovanie, nie vyhľadávanie, je hlavným obmedzením pre podnikovú finančnú AI.

Sekvenčná konzistentnosť: Väčšinové hlasovanie pri vzorkovaní zlepšuje presnosť reťazca myšlienok

Sekvenčná konzistentnosť nahrádza greedy dekódovanie reťazca myšlienok väčšinovým hlasovaním cez N vzorkovaných ciest uvažovania — čím zvyšuje presnosť GPT-3 na GSM8K o 17,9 percentuálneho bodu bez dodatočného trénovania — a priamo sa aplikuje na viackrokové finančné výpočty, kde je jediné dekódovanie modelu nespoľahlivé.