FinQA: محک سنجش استدلال عددی هوش مصنوعی در گزارشهای مالی
FinQA (EMNLP 2021) با ایجاد ۸,۲۸۱ جفت پرسش و پاسخ از گزارشهای سوددهی S&P 500 که نیازمند برنامههای محاسباتی چند مرحلهای هستند، بنا شده است. مدلهای عصبی در زمان انتشار امتیاز ۶۱٪ را در مقابل ۹۱٪ خبرگان انسانی کسب کردند؛ دقت در برنامههای سه مرحلهای یا بیشتر به ۲۲٪ کاهش مییابد. حالتهای شکست — ثابتهای حوزه، اتصال متقابل (cross-modality grounding)، طول زنجیره — مستقیماً با چالشهایی که امروزه ایجنتهای Beancount با آن روبرو هستند، همسو است.