Перейти к основному содержимому

#reconciliation

Сверка

Автоматизированная сверка реестра с помощью агентов на языковых моделях

Могут ли LLM-агенты быть финансовыми директорами? 132-месячная симуляция EnterpriseArena выявляет огромный разрыв

Только Qwen3.5-9B выдерживает 80% из 132-месячных прогонов CFO в EnterpriseArena, а GPT-5.4 и DeepSeek-V3.1 достигают 0%. Причина сбоев — пропущенная сверка регистра.

FinMCP-Bench: Тестирование LLM-агентов для решения реальных финансовых задач с использованием инструментов в рамках протокола MCP

FinMCP-Bench: лучший из шести LLM даёт лишь 3,08% точных совпадений на 613 реальных финансовых задачах MCP — падение в 20 раз от одного инструмента к многошаговым.

Найдено посередине: калибровка позиционного смещения внимания улучшает RAG с длинным контекстом

Вычитание позиционного смещения из весов внимания LLM возвращает до 15 пунктов точности RAG, когда доказательства в середине контекста, помогая конвейерам финансовых агентов.

Voyager: библиотеки навыков открывают в 3,3 раза больше предметов

Постоянная библиотека навыков кода Voyager обнаруживает в 3,3 раза больше предметов Minecraft, чем предыдущий SOTA без тонкой настройки — реестр повторного использования, необходимый агентам журнала.