Перейти до основного вмісту

#data-science

Наука про дані

Методи науки про дані для фінансових наборів даних і бухгалтерських процесів

WildToolBench: Чому жодна LLM не перевищує 15% точності сесії при реальному використанні інструментів

WildToolBench: жодна LLM не перевищує 15% сесійної точності на 1 024 завданнях реальних користувачів, а найгостріші збої — прихований намір і переходи інструкцій.

Впевненість та калібрування LLM: Огляд того, що насправді показують дослідження

Вербалізована впевненість GPT-4 сягає лише ~62,7% AUROC — ледь вище за випадковість. Фінансовим агентам з урахуванням невизначеності потрібне краще калібрування.

Огляд виявлення аномалій за допомогою LLM (NAACL 2025): сильна таксономія, відсутність охоплення табличних даних

Таксономія NAACL 2025 залишається чинною, але табличні дані поза увагою. Командам фінансового AI доведеться самим адаптувати методи для vision-моделей.

Знайдено посередині: Калібрування позиційного зміщення уваги покращує RAG з довгим контекстом

Віднімання позиційного зсуву з ваг уваги LLM повертає до 15 пунктів точності RAG, коли доказ лежить у середині контексту, допомагаючи конвеєрам фінансових агентів.

FinDER: реальні запити аналітиків виявили 74% розриву в повноті фінансових RAG-систем

5 703 реальні запити аналітиків у FinDER показують: найкращий RAG відтворює лише 25,95% доказів із 10-K. Спершу нормалізуйте абревіатури, а вже потім міняйте ембединги.

Загублені посередині: упередженість щодо позиції в LLM та її вплив на ШІ у сфері фінансів

LLM набирають до 20 балів менше, коли відповідь міститься в середині контексту, тож фінансові RAG-конвеєри мають розміщувати найкращі уривки першими або останніми.

CausalTAD: Каузальне впорядкування стовпців для виявлення аномалій у табличних даних за допомогою LLM

CausalTAD перевпорядковує стовпці таблиці за причинно-наслідковою залежністю перед серіалізацією LLM, підвищуючи середній AUC-ROC з 0,803 до 0,834 порівняно з AnoLLM.