Перейти до основного вмісту

#automation

Автоматизація

Техніки та інструменти автоматизації для обробки фінансових даних

WildToolBench: Чому жодна LLM не перевищує 15% точності сесії при реальному використанні інструментів

WildToolBench: жодна LLM не перевищує 15% сесійної точності на 1 024 завданнях реальних користувачів, а найгостріші збої — прихований намір і переходи інструкцій.

FinMCP-Bench: Бенчмаркінг агентів LLM для реального використання фінансових інструментів під управлінням MCP

FinMCP-Bench оцінює найкращу з шести LLM лише в 3,08% точного збігу на 613 реальних фінансових задачах MCP — 20-кратний обвал від одного інструмента до багатокроковості.

FinTrace: оцінка виклику інструментів LLM для фінансових завдань на рівні траєкторії

FinTrace показує: передові LLM обирають правильні фінансові інструменти (F1 ~0,9), але мають лише 3,23/5 за використання результатів — саме цей крок ламає агентів запису.

Знайдено посередині: Калібрування позиційного зміщення уваги покращує RAG з довгим контекстом

Віднімання позиційного зсуву з ваг уваги LLM повертає до 15 пунктів точності RAG, коли доказ лежить у середині контексту, допомагаючи конвеєрам фінансових агентів.

Передавання завдань з урахуванням невизначеності для агентів LLM: коли переходити від малих до великих моделей

ReDAct делегує від малої моделі до великої лише коли перплексія сигналізує про невизначеність, скорочуючи витрати на 64% за тієї ж точності для агентних робочих процесів.

OpenHands: Відкрита платформа для програмних агентів ШІ та що вона означає для автоматизації фінансів

Агент CodeAct від OpenHands набирає 26% на SWE-Bench Lite, показуючи, що AI-агенти надійно роблять сьогодні. Фінансову автоматизацію варто починати вузько, не з автономії.

Виявлення аномалій за методом Zero-Shot за допомогою LLM: Як GPT-4 працює з табличними даними

GPT-4 досягає 74.1 середнього AUROC на ODDS zero-shot, близько до базової лінії ECOD 75.5, але зазнає невдачі на даних із високою дисперсією. Аудит реєстру ще не розв'язано.