
FinRAGBench-V: Мультимодальний RAG із візуальним цитуванням у фінансовій сфері
FinRAGBench-V: найкращі моделі сягають лише 20–61% recall цитат на рівні блоків на фінансових сторінках. Мультимодальний пошук випереджає текстовий майже на 50 пунктів.
#finance
Фінансові дослідження, аналіз і предметні знання для бухгалтерського ШІ

FinRAGBench-V: найкращі моделі сягають лише 20–61% recall цитат на рівні блоків на фінансових сторінках. Мультимодальний пошук випереджає текстовий майже на 50 пунктів.

Вербалізована впевненість GPT-4 сягає лише ~62,7% AUROC — ледь вище за випадковість. Фінансовим агентам з урахуванням невизначеності потрібне краще калібрування.

FinTrace показує: передові LLM обирають правильні фінансові інструменти (F1 ~0,9), але мають лише 3,23/5 за використання результатів — саме цей крок ламає агентів запису.

OmniEval оцінює найкращі RAG-системи лише у 36% числової точності за 5 типами фінансових завдань, тож агентам для леджерів потрібна валідація перед записом проводок.

5 703 реальні запити аналітиків у FinDER показують: найкращий RAG відтворює лише 25,95% доказів із 10-K. Спершу нормалізуйте абревіатури, а вже потім міняйте ембединги.

LLM набирають до 20 балів менше, коли відповідь міститься в середині контексту, тож фінансові RAG-конвеєри мають розміщувати найкращі уривки першими або останніми.

AnoLLM перевершує класичні методи на змішаних даних про шахрайство, оцінюючи рядки через негативну логправдоподібність LLM, але не дає переваги на суто числових таблицях.

DocFinQA замінює 700-слівні уривки FinQA на повні звіти SEC — у 175 разів довший контекст, що майже вдвічі знижує точність GPT-4 на довгих документах.

TheAgentCompany оцінює 175 корпоративних завдань у симульованій інтрамережі, і найкраща модель, Gemini-2.5-Pro, виконує лише 30% за $4 кожне.

InvestorBench: Qwen2.5-72B лідирує в торгівлі акціями з CR 46,15%; фінансово налаштована Palmyra-Fin дає збій на акціях — розмір перемагає доменне налаштування.

За однакового бюджету токенів мислення один агент LLM дорівнює або перевершує мультиагентні системи у багатокрокових міркуваннях — обирайте простіші дизайни фінансових агентів.

M3MAD-Bench виявляє, що колективна омана спричиняє 65% невдач дебатів кількох агентів, а змагальні дебати знижують точність до 12.8%.