FinQA: Бенчмарк для вимірювання чисельних міркувань ШІ у фінансових звітах
FinQA (EMNLP 2021) зібрав 8 281 пару питань та відповідей зі звітів про прибутки компаній S&P 500, що потребують багатоетапних арифметичних програм. Нейронні моделі набрали 61% на момент випуску проти 91% у експертів-людей; точність падає до 22% у програмах з трьома або більше етапами. Режими збоїв — доменні константи, крос-модальне обґрунтування, довжина ланцюжка — безпосередньо відображають виклики, з якими сьогодні стикаються агенти Beancount.