#financial-literacy
Financial Literacy
Research on financial knowledge representation and LLM competency
Gli LLM Ottengono il 2,3% sulla Generazione di DSL Beancount: Il Benchmark LLMFinLiteracy
Il benchmark LLMFinLiteracy rileva che cinque modelli open-weight da circa 7B generano transazioni Beancount completamente corrette solo nel 2,3% dei casi, con errori concentrati nel ragionamento contabile—non nella sintassi—indicando il feedback compiler-in-the-loop come ingrediente critico mancante per agenti di write-back affidabili.
Benchmark FinMaster: perché i modelli linguistici di grandi dimensioni ottengono il 96% in alfabetizzazione finanziaria ma il 3% nella generazione di rendiconti
FinMaster (arXiv:2505.13533) valuta o3-mini, Claude 3.7 Sonnet e DeepSeek-V3 in 183 attività finanziarie, rivelando che i modelli ottengono il 96% in alfabetizzazione finanziaria, ma crollano al 3% nella generazione di rendiconti, con attività di consulenza multi-step che perdono 21 punti di accuratezza a causa della propagazione degli errori.