Перейти до основного вмісту

#machine-learning

Машинне навчання

Методи машинного навчання для аналізу та автоматизації фінансових даних

WildToolBench: Чому жодна LLM не перевищує 15% точності сесії при реальному використанні інструментів

WildToolBench: жодна LLM не перевищує 15% сесійної точності на 1 024 завданнях реальних користувачів, а найгостріші збої — прихований намір і переходи інструкцій.

Впевненість та калібрування LLM: Огляд того, що насправді показують дослідження

Вербалізована впевненість GPT-4 сягає лише ~62,7% AUROC — ледь вище за випадковість. Фінансовим агентам з урахуванням невизначеності потрібне краще калібрування.

FinMCP-Bench: Бенчмаркінг агентів LLM для реального використання фінансових інструментів під управлінням MCP

FinMCP-Bench оцінює найкращу з шести LLM лише в 3,08% точного збігу на 613 реальних фінансових задачах MCP — 20-кратний обвал від одного інструмента до багатокроковості.

FinTrace: оцінка виклику інструментів LLM для фінансових завдань на рівні траєкторії

FinTrace показує: передові LLM обирають правильні фінансові інструменти (F1 ~0,9), але мають лише 3,23/5 за використання результатів — саме цей крок ламає агентів запису.

Огляд виявлення аномалій за допомогою LLM (NAACL 2025): сильна таксономія, відсутність охоплення табличних даних

Таксономія NAACL 2025 залишається чинною, але табличні дані поза увагою. Командам фінансового AI доведеться самим адаптувати методи для vision-моделей.

Знайдено посередині: Калібрування позиційного зміщення уваги покращує RAG з довгим контекстом

Віднімання позиційного зсуву з ваг уваги LLM повертає до 15 пунктів точності RAG, коли доказ лежить у середині контексту, допомагаючи конвеєрам фінансових агентів.

Передавання завдань з урахуванням невизначеності для агентів LLM: коли переходити від малих до великих моделей

ReDAct делегує від малої моделі до великої лише коли перплексія сигналізує про невизначеність, скорочуючи витрати на 64% за тієї ж точності для агентних робочих процесів.

OpenHands: Відкрита платформа для програмних агентів ШІ та що вона означає для автоматизації фінансів

Агент CodeAct від OpenHands набирає 26% на SWE-Bench Lite, показуючи, що AI-агенти надійно роблять сьогодні. Фінансову автоматизацію варто починати вузько, не з автономії.