FinQA: бенчмарк для измерения численного мышления ИИ в финансовых отчетах
В рамках проекта FinQA (EMNLP 2021) была создана база из 8 281 пары вопросов и ответов на основе отчетов о доходах компаний из индекса S&P 500, требующих выполнения многошаговых арифметических программ. На момент выпуска нейросетевые модели набирали 61% баллов против 91% у экспертов-людей; точность падает до 22% в программах из трех и более шагов. Типичные ошибки — использование доменных констант, кросс-модальная привязка, длина цепочки рассуждений — напрямую отражают проблемы, с которыми сегодня сталкиваются агенты Beancount.