FinQA: Der Benchmark zur Messung numerischer Schlussfolgerungen von KI in Finanzberichten
FinQA (EMNLP 2021) erstellte 8.281 Q&A-Paare aus S&P 500-Ergebnisberichten, die mehrstufige arithmetische Programme erfordern. Neuronale Modelle erzielten bei Veröffentlichung 61 % gegenüber 91 % bei menschlichen Experten; die Genauigkeit bricht bei Programmen mit drei oder mehr Schritten auf 22 % ein. Die Fehlermodi – Domänenkonstanten, modalitätsübergreifende Verankerung, Kettenlänge – lassen sich direkt auf die Herausforderungen übertragen, vor denen Beancount-Agenten heute stehen.