FinBen се появи на NeurIPS 2024 като най-изчерпателната публична оценка на LLM върху финансови задачи досега. Исках да го прочета внимателно, защото преди да проектирам какъвто и да е автономен агент върху Beancount ledgers, имам нужда от реалистична картина за това къде всъщност се намират най-модерните модели по отношение на финансовите разсъждаващи задачи, които такъв агент би трябвало да изпълнява.
Документът
Qianqian Xie и 33 съавтори представят FinBen, бенчмарк с отворен код, обхващащ 36 набора от данни в 24 финансови задачи, организирани в седем измерения: извличане на информация, текстов анализ, отговаряне на въпроси, генериране на текст, управление на риска, прогнозиране и вземане на решения. Те оценяват 15 представителни LLM — включително GPT-4, ChatGPT, Gemini и няколко инструктуирани модела с отворен код — и въвеждат три нови набора от данни за обобщаване, отговаряне на въпроси и оценка на търговията с акции.
Основната мотивация е, че предишни финансови бенчмаркове като FLUE и FLARE обхващаха част от финансовата NLP, но нищо близко до пълния процес. FinBen е първият опит да обхване целия стек на едно място и беше приет в NeurIPS 2024 Datasets and Benchmarks Track, което му дава разумна марка за методологическа проверка.
Ключови идеи
- При разпознаване на именувани същности, GPT-4 постига 0.83 Entity F1 върху набора от данни FINER-ORD — силно, но това е най-лесната категория в бенчмарка.
- При FinQA (числови разсъждения върху финансови отчети), GPT-4 достига 0.63 точно съвпадение; при разговорния вариант ConvFinQA, то постига 0.76. Това са уважаваеми резултати, но далеч от решени.
- Домейн-финно настроеният FinMA 7B постига 0.88 F1 при FPB сантимент — превъзхождайки GPT-4 по тази тясна задача, потвърждавайки, че финото настройване все още носи нещо при добре дефинирана класификация.
- Прогнозирането на движения на акции е най-очевидният случай на провал: дори GPT-4 постига приблизително 0.54 точност — едва над случайното. Авторите наричат това „забележителен недостатък в способността на LLM да се справят с прогнозирането“.
- GPT-4 постига коефициент на Sharpe от 1.51 при търговската задача срещу 1.03 за Gemini и кумулативна доходност от 28.19% срещу −4.00% при стратегия „купи и дръж“ през оценъчния период — но това е кратък бектест с всички обичайни уговорки.
- Всички модели постигнаха нула при извличащото обобщаване, а GPT-4 постигна 0.01 F1 при извличане на отношения. Способностите рязко спадат извън комфортната зона на класификация на текст и отворено генериране.
Какво издържа — и какво не
Бенчмаркът е наистина полезен като инструмент за проучване. Обхватът от задачи е по-широк от всичко, което е било преди, и публикуването с отворен код означава, че други могат да надграждат инфраструктурата за оценка, вместо да започват отначало.
Това казано, имам реални притеснения относно това какво всъщност може да ви каже FinBen. Оценъчният период за търговия е кратък и специфичен за пазара; коефициент на Sharpe, изчислен за няколко месеца върху американски акции, не е стабилен сигнал. Нулевите резултати при извличащото обобщаване ни казват, че нещо е счупено, но документът не диагностицира защо — дали е проблем с формата на prompt-а, артефакт на токенизацията или истински провал в разсъжденията? Разликата има значение за всеки, който се опитва да го поправи.
Бенчмаркът също е почти изцяло англоезичен и ориентиран към американския пазар. Това не е просто уговорка за обобщение; означава, че резултатите ви казват много малко за представянето върху, да речем, немски или китайски финансови документи, или в юрисдикции с различни счетоводни стандарти. За проект като Beancount.io, обслужващ глобална потребителска база, това е значителна празнина.
Историята с инструктуираните модели също е по-мътна, отколкото изглежда на пръв поглед. Финото настройване помага при сантимента (FinMA 7B при 0.88), но „предоставя само маргинални подобрения за сложни задачи като QA“. Документът съобщава това като констатация, но не предлага механистично обяснение. Дали е катастрофално забравяне на способността за разсъждение на основния модел? Дали разпределението на данните за фино настройване е твърде тясно? Само повърхността на бенчмарка не може да отговори на това.
Защо това има значение за финансовия ИИ
Резултатите от FinBen дават на Bean Labs по-чиста базова линия от преди. Задачите, които са най-подходящи за Beancount ledger агент — числови QA върху структурирани финансови отчети (FinQA: 0.63 точно съвпадение), извличане на информация от описания на транзакции (NER: 0.83 F1) и откриване на аномалии или класификация на измами (задачи за управление на риска, показващи голямо разнообразие) — всички са представени тук и нито една не е решена.
Колапсът при прогнозирането (0.54 при движение на акции) всъщност е успокояващ за нашия по-тесен случай на употреба: не молим моделите да предвиждат пазари, а да класифицират, извличат и записват структурирани записи. Тези задачи попадат в диапазона 0.63–0.83 в зависимост от сложността, което е работеща основа — макар че „работещо“ не означава „сигурно за производство без човешка проверка“.
Празнината между структурираното извличане и разсъжденията с отворен край също се отразява директно върху проблема с безопасността при записване. Ако моделът може надеждно да извлече същност (F1 0.83), но се затруднява да разсъждава върху нейните числови последици (FinQA 0.63) или да генерира правилен структуриран изход (извличане на отношения: 0.01), тогава най-безопасната архитектура държи тези стъпки отделни, с изрична валидация между тях.
Какво да прочетете по-нататък
- FinMaster (arXiv:2505.13533) — изрично оценява цялостни счетоводни процеси, включително журнални записи и съгласуване; по-близо до задачата на Beancount от всичко в FinBen.
- „Table Meets LLM: Могат ли големите езикови модели да разбират структурирани таблични данни?“ (arXiv:2305.13062, WSDM 2024) — Beancount ledgers са по същество структурирани таблици; този документ оценява точно способностите за структурно разбиране, които са в основата на всеки агент, четящ ledger.
- ReAct: Синергизиране на разсъждение и действие в езикови модели (arXiv:2210.03629) — рамката с редуващи се разсъждение и действие е това, което повечето агенти за записване биха използвали; разбирането на нейните режими на провал има значение още повече, сега когато FinBen показа къде всъщност е дъното на разсъжденията.





