
FinToolBench: Оцінювання LLM-агентів у реальному використанні фінансових інструментів
FinToolBench виявляє невідповідність намірів понад 50% у кожної протестованої LLM, тож агресивні виклики інструментів не дають кращих відповідей у фінансах.
#compliance
Відповідність нормативам, політики та аудит для фінансових ШІ-систем

FinToolBench виявляє невідповідність намірів понад 50% у кожної протестованої LLM, тож агресивні виклики інструментів не дають кращих відповідей у фінансах.

STPA разом із розширеним MCP дає формальні специфікації безпеки для інструментів LLM, а Alloy доводить відсутність небезпечних потоків у кейсі з календарем.

FinAuditing shows top LLMs hit just 13.86% on financial math verification of real SEC XBRL filings, capping what AI accounting tools can automate unaided.

Охорона AGrail з двох LLM знижує успішність атак через ін'єкцію підказок до 0%, зберігаючи 95.6% доброякісних дій агента на Safe-OS.

ShieldAgent дає 90,4% точності на атаках агентів і на 64,7% менше викликів API завдяки ймовірнісним схемам правил замість LLM-огорож.

AuditCopilot знижує хибні спрацювання виявлення шахрайства в проводках з 942 до 12, але абляція показує: LLM лише синтезує оцінки Isolation Forest.

Конституційний ШІ замінює вручну розмічені дані про шкоду зворотним зв'язком ШІ, тож бухгалтерські агенти застосовують правила реєстру без рецензента на кожну транзакцію.