Перейти к основному содержимому

#automation

Автоматизация

Методы и инструменты автоматизации обработки финансовых данных

Могут ли LLM-агенты быть финансовыми директорами? 132-месячная симуляция EnterpriseArena выявляет огромный разрыв

Только Qwen3.5-9B выдерживает 80% из 132-месячных прогонов CFO в EnterpriseArena, а GPT-5.4 и DeepSeek-V3.1 достигают 0%. Причина сбоев — пропущенная сверка регистра.

WildToolBench: Почему ни одна LLM не превышает 15% точности сессии в реальных сценариях использования инструментов

WildToolBench обнаруживает, что ни одна LLM не превышает 15% точности сессий на 1 024 задачах реальных пользователей; скрытые намерения и смена инструкций — худшие сбои.

JSONSchemaBench: Сложность реальных схем нарушает гарантии структурированного вывода LLM

JSONSchemaBench обнаруживает, что покрытие падает с 86% на простых схемах до 3% на сложных, поэтому структурный вывод LLM может незаметно выдавать несоответствующий JSON.

FinMCP-Bench: Тестирование LLM-агентов для решения реальных финансовых задач с использованием инструментов в рамках протокола MCP

FinMCP-Bench: лучший из шести LLM даёт лишь 3,08% точных совпадений на 613 реальных финансовых задачах MCP — падение в 20 раз от одного инструмента к многошаговым.

Найдено посередине: калибровка позиционного смещения внимания улучшает RAG с длинным контекстом

Вычитание позиционного смещения из весов внимания LLM возвращает до 15 пунктов точности RAG, когда доказательства в середине контекста, помогая конвейерам финансовых агентов.

Учёт неопределенности при делегировании задач LLM-агентами: когда переходить от малых моделей к большим

ReDAct переходит от малой модели к большой только когда перплексия сигнализирует о неопределённости, снижая затраты на 64% при той же точности для рабочих процессов агентов.

OpenHands: открытая платформа для ИИ-агентов-разработчиков и её значение для автоматизации финансов

Агент CodeAct от OpenHands набирает 26% на SWE-Bench Lite, показывая, что ИИ-агенты умеют надёжно сегодня. Автоматизацию финансов стоит начинать узко, а не автономно.

Zero-Shot обнаружение аномалий с помощью LLM: Как GPT-4 справляется с табличными данными

GPT-4 достигает среднего AUROC 74,1 на ODDS в режиме zero-shot, близко к базовой линии ECOD 75,5, но проваливается на данных с высокой дисперсией. Аудит регистра ещё не решён.