
FinToolBench: Оценка LLM-агентов на реальном использовании финансовых инструментов
FinToolBench обнаруживает несоответствие намерений выше 50% у всех протестированных LLM, значит частое использование инструментов не даёт лучших ответов в финансах.
#compliance
Регуляторное соответствие, политики и аудиторский след для финансовых ИИ-систем

FinToolBench обнаруживает несоответствие намерений выше 50% у всех протестированных LLM, значит частое использование инструментов не даёт лучших ответов в финансах.

STPA вместе с расширенным MCP даёт формальные спецификации безопасности для инструментов LLM, а Alloy доказывает отсутствие небезопасных потоков в примере с календарём.

FinAuditing shows top LLMs hit just 13.86% on financial math verification of real SEC XBRL filings, capping what AI accounting tools can automate unaided.

Ограждение AGrail на двух LLM снижает успех атак через промпт-инъекции до 0%, сохраняя 95.6% доброкачественных действий агента на Safe-OS.

ShieldAgent достигает 90.4% точности на атаках агентов при 64.7% меньшем числе вызовов API, используя вероятностные схемы правил вместо LLM-ограждений.

AuditCopilot снижает ложные срабатывания при выявлении мошенничества в проводках с 942 до 12, но абляция показывает, что LLM в основном синтезирует оценки Isolation Forest.

Constitutional AI заменяет ручную разметку вредоносных данных обратной связью ИИ, позволяя бухгалтерским агентам применять правила реестра без проверяющего на каждую операцию.