
FinRAGBench-V: Мультимодальний RAG із візуальним цитуванням у фінансовій сфері
FinRAGBench-V: найкращі моделі сягають лише 20–61% recall цитат на рівні блоків на фінансових сторінках. Мультимодальний пошук випереджає текстовий майже на 50 пунктів.
#data-science
Методи науки про дані для фінансових наборів даних і бухгалтерських процесів

FinRAGBench-V: найкращі моделі сягають лише 20–61% recall цитат на рівні блоків на фінансових сторінках. Мультимодальний пошук випереджає текстовий майже на 50 пунктів.

WildToolBench: жодна LLM не перевищує 15% сесійної точності на 1 024 завданнях реальних користувачів, а найгостріші збої — прихований намір і переходи інструкцій.

Вербалізована впевненість GPT-4 сягає лише ~62,7% AUROC — ледь вище за випадковість. Фінансовим агентам з урахуванням невизначеності потрібне краще калібрування.

FinToolBench виявляє невідповідність намірів понад 50% у кожної протестованої LLM, тож агресивні виклики інструментів не дають кращих відповідей у фінансах.

OmniEval оцінює найкращі RAG-системи лише у 36% числової точності за 5 типами фінансових завдань, тож агентам для леджерів потрібна валідація перед записом проводок.

Таксономія NAACL 2025 залишається чинною, але табличні дані поза увагою. Командам фінансового AI доведеться самим адаптувати методи для vision-моделей.

Віднімання позиційного зсуву з ваг уваги LLM повертає до 15 пунктів точності RAG, коли доказ лежить у середині контексту, допомагаючи конвеєрам фінансових агентів.

Fin-RATE показує, що точність LLM обвалюється на 18,60% під час лонгітюдного відстеження, а вузьким місцем є конвеєр пошуку, а не модель.

5 703 реальні запити аналітиків у FinDER показують: найкращий RAG відтворює лише 25,95% доказів із 10-K. Спершу нормалізуйте абревіатури, а вже потім міняйте ембединги.

LLM набирають до 20 балів менше, коли відповідь міститься в середині контексту, тож фінансові RAG-конвеєри мають розміщувати найкращі уривки першими або останніми.

AD-LLM виявляє, що GPT-4o досягає 0,93–0,99 AUROC у zero-shot для виявлення текстових аномалій, але вибір моделі LLM залишається ненадійним для ШІ фінансового аудиту.

CausalTAD перевпорядковує стовпці таблиці за причинно-наслідковою залежністю перед серіалізацією LLM, підвищуючи середній AUC-ROC з 0,803 до 0,834 порівняно з AnoLLM.