
FinToolBench:评估LLM代理在真实金融工具使用中的表现
FinToolBench发现,所有受测LLM的意图不匹配率均超过50%,因此激进的工具调用并不意味着在金融任务上有更好的答案。
#compliance

FinToolBench发现,所有受测LLM的意图不匹配率均超过50%,因此激进的工具调用并不意味着在金融任务上有更好的答案。

STPA 加上能力增强的 MCP 为 LLM 工具使用产出形式化安全规范,并用 Alloy 在一个日历案例中证明不存在不安全流程。

FinAuditing 显示,顶级 LLM 在真实 SEC XBRL 文件的金融数学验证上仅得 13.86%,这限定了 AI 会计工具无法独立自动化的范围。

AGrail 的双 LLM 护栏将提示注入攻击成功率降至 0%,同时在 Safe-OS 上保留 95.6% 的正常智能体操作。

ShieldAgent 用概率规则电路替代 LLM 护栏,对智能体攻击达 90.4% 准确率,API 调用减少 64.7%。

AuditCopilot 将日记账分录欺诈误报从 942 降至 12,但消融实验显示 LLM 主要在综合 Isolation Forest 的分数。

宪法式AI用AI反馈替代人工标注的有害数据,让会计智能体无需为每笔交易配备审核员,即可执行账本规则。