Перейти до основного вмісту

#finance

Фінанси

Фінансові дослідження, аналіз і предметні знання для бухгалтерського ШІ

Впевненість та калібрування LLM: Огляд того, що насправді показують дослідження

Вербалізована впевненість GPT-4 сягає лише ~62,7% AUROC — ледь вище за випадковість. Фінансовим агентам з урахуванням невизначеності потрібне краще калібрування.

FinTrace: оцінка виклику інструментів LLM для фінансових завдань на рівні траєкторії

FinTrace показує: передові LLM обирають правильні фінансові інструменти (F1 ~0,9), але мають лише 3,23/5 за використання результатів — саме цей крок ламає агентів запису.

FinDER: реальні запити аналітиків виявили 74% розриву в повноті фінансових RAG-систем

5 703 реальні запити аналітиків у FinDER показують: найкращий RAG відтворює лише 25,95% доказів із 10-K. Спершу нормалізуйте абревіатури, а вже потім міняйте ембединги.

Загублені посередині: упередженість щодо позиції в LLM та її вплив на ШІ у сфері фінансів

LLM набирають до 20 балів менше, коли відповідь міститься в середині контексту, тож фінансові RAG-конвеєри мають розміщувати найкращі уривки першими або останніми.

AnoLLM: тонке налаштування LLM для виявлення аномалій у табличних фінансових даних

AnoLLM перевершує класичні методи на змішаних даних про шахрайство, оцінюючи рядки через негативну логправдоподібність LLM, але не дає переваги на суто числових таблицях.

Один агент: дорівнює MAS на багатокрокових завданнях за однакової кількості токенів

За однакового бюджету токенів мислення один агент LLM дорівнює або перевершує мультиагентні системи у багатокрокових міркуваннях — обирайте простіші дизайни фінансових агентів.