Перейти к основному содержимому

#ai

ИИ

Исследования и применение искусственного интеллекта в финансах и бухгалтерии

Могут ли LLM-агенты быть финансовыми директорами? 132-месячная симуляция EnterpriseArena выявляет огромный разрыв

Только Qwen3.5-9B выдерживает 80% из 132-месячных прогонов CFO в EnterpriseArena, а GPT-5.4 и DeepSeek-V3.1 достигают 0%. Причина сбоев — пропущенная сверка регистра.

WildToolBench: Почему ни одна LLM не превышает 15% точности сессии в реальных сценариях использования инструментов

WildToolBench обнаруживает, что ни одна LLM не превышает 15% точности сессий на 1 024 задачах реальных пользователей; скрытые намерения и смена инструкций — худшие сбои.

JSONSchemaBench: Сложность реальных схем нарушает гарантии структурированного вывода LLM

JSONSchemaBench обнаруживает, что покрытие падает с 86% на простых схемах до 3% на сложных, поэтому структурный вывод LLM может незаметно выдавать несоответствующий JSON.

FinMCP-Bench: Тестирование LLM-агентов для решения реальных финансовых задач с использованием инструментов в рамках протокола MCP

FinMCP-Bench: лучший из шести LLM даёт лишь 3,08% точных совпадений на 613 реальных финансовых задачах MCP — падение в 20 раз от одного инструмента к многошаговым.

Обзор методов обнаружения аномалий с помощью LLM (NAACL 2025): сильная таксономия, отсутствие охвата табличных данных

Таксономия NAACL 2025 работает, но охват таблиц отсутствует. Командам финансового ИИ придётся самим адаптировать методы визуальных моделей.

Найдено посередине: калибровка позиционного смещения внимания улучшает RAG с длинным контекстом

Вычитание позиционного смещения из весов внимания LLM возвращает до 15 пунктов точности RAG, когда доказательства в середине контекста, помогая конвейерам финансовых агентов.

Учёт неопределенности при делегировании задач LLM-агентами: когда переходить от малых моделей к большим

ReDAct переходит от малой модели к большой только когда перплексия сигнализирует о неопределённости, снижая затраты на 64% при той же точности для рабочих процессов агентов.