
FinToolBench: Hodnotenie LLM agentov na reálnych finančných nástrojoch
FinToolBench spája 760 živých finančných API nástrojov s 295 spustiteľnými dotazmi na hodnotenie LLM agentov pri reálnych finančných úlohách – odhaľuje, že konzervatívna 22,7 % miera volaní GPT-4o prináša vyššiu kvalitu odpovedí (CSS 0,670) ako agresívny TIR 87,1 % modelu Qwen3-8B, pričom nesúlad zámeru presahuje 50 % pri každom testovanom modeli.





