
MultiHiertt: Benchmarking numerického uvažovania nad multi-hierarchickými finančnými tabuľkami
MultiHiertt ukazuje, že modely dosahujú 38 % F1 oproti 87 % u ľudí na 10 440 finančných QA pároch, s poklesom o 15 bodov pri otázkach naprieč tabuľkami.
#financial-statements
Výskum generovania súvahy, výkazu ziskov a strát a cash-flow

MultiHiertt ukazuje, že modely dosahujú 38 % F1 oproti 87 % u ľudí na 10 440 finančných QA pároch, s poklesom o 15 bodov pri otázkach naprieč tabuľkami.

FinanceBench testuje 16 AI zostáv na 10 231 otázkach z podaní SEC: RAG so zdieľaným vektorovým úložiskom odpovie správne len v 19 %, takže vyhľadávanie nie je úzkym hrdlom.

FinMaster Benchmark: špičkové LLM dosahujú 96 % vo finančnej gramotnosti, ale len 3 % pri generovaní výkazov. Šírenie chýb stojí 21 bodov pri konzultačných úlohách.