FinQA: Il Benchmark che Misura il Ragionamento Numerico dell'IA sui Report Finanziari
FinQA (EMNLP 2021) ha costruito 8.281 coppie QA dai report sugli utili delle aziende S&P 500, richiedendo programmi aritmetici multi-step. I modelli neurali hanno ottenuto un punteggio del 61% al rilascio, contro il 91% degli esperti umani; l'accuratezza crolla al 22% su programmi con tre o più passaggi. Le modalità di fallimento — costanti di dominio, grounding cross-modale, lunghezza della catena — corrispondono direttamente alle sfide che gli agenti Beancount affrontano oggi.