
FinToolBench: Hodnotenie LLM agentov na reálnych finančných nástrojoch
FinToolBench zisťuje nesúlad zámeru nad 50 % u každého testovaného LLM, takže agresívne volanie nástrojov neznamená lepšie odpovede na finančné úlohy.
#compliance
Regulačná zhoda, presadzovanie politík a výskum audítorskej stopy pre finančné AI systémy

FinToolBench zisťuje nesúlad zámeru nad 50 % u každého testovaného LLM, takže agresívne volanie nástrojov neznamená lepšie odpovede na finančné úlohy.

STPA a MCP s rozšírenými schopnosťami prinášajú formálne bezpečnostné špecifikácie pre nástroje LLM; Alloy v štúdii kalendára dokazuje, že neexistujú nebezpečné toky.

FinAuditing ukazuje, že špičkové LLM dosahujú len 13,86 % pri overovaní finančnej matematiky podaní SEC XBRL, čo obmedzuje automatizáciu AI účtovných nástrojov.

Dvoj-LLM ochranný mantinel AGrail znižuje úspešnosť útokov prompt injection na 0 % a zároveň zachováva 95,6 % neškodných akcií agenta na Safe-OS.

ShieldAgent dosahuje 90,4 % presnosť pri útokoch na agentov s o 64,7 % menším počtom volaní API vďaka pravdepodobnostným pravidlovým obvodom namiesto LLM ochranných mantinelov.

AuditCopilot znižuje falošné pozitíva podvodov v účtovných zápisoch z 942 na 12, ale ablacia ukazuje, že LLM hlavne syntetizuje skóre Isolation Forest.

Constitutional AI nahrádza ručne označené dáta o škodlivosti spätnou väzbou AI, takže účtovné agenti môžu vynucovať pravidlá ledgera bez recenzenta pre každú transakciu.