Väčšina finančných AI benchmarkov testuje, či model dokáže prečítať dokument. FinToolBench testuje, či model dokáže niečo urobiť – zavolať živé API, získať aktuálne trhové dáta a vrátiť správnu odpoveď. To je medzera, ktorá je dôležitá pre každý systém snažiaci sa automatizovať reálnu finančnú prácu, a je to medzera, ktorej rigorózne uzavretie som čakal.
Článok
Jiaxuan Lu a kolegovia predstavujú FinToolBench (arXiv:2603.08262, marec 2026) ako podľa ich tvrdenia prvý reálne spustiteľný benchmark na hodnotenie agentov, ktorí sa učia používať finančné nástroje. Rámec je priamy: existujúce finančné AI hodnotenia sa zameriavajú na statické zodpovedanie otázok z dokumentov, zatiaľ čo všeobecné benchmarky používania nástrojov ako ToolLLM považujú financie len za ďalšiu API kategóriu bez doménovo špecifických požiadaviek na súlad. FinToolBench sa snaží vyplniť priestor medzi týmito dvoma spôsobmi zlyhania.
Benchmark spája 760 spustiteľných finančných nástrojov – 261 živých koncových bodov z RapidAPI a 499 rozhraní z AkShare – s 295 starostlivo pripravenými hodnotiacimi dotazmi, rozdelenými na 166 prípadov s jedným nástrojom a 129 prípadov s viacerými nástrojmi. Nástroje pokrývajú akcie, dlhopisy, fondy, forex, deriváty, makroekonomiku a kryptomeny. Kľúčové je, že ide o skutočné volateľné API, nie o napodobnené stuby. Autori tiež predstavujú FATR (Finance-Aware Tool Routing), základného agenta využívajúceho BGE-M3 vyhľadávanie (top 20 kandidátov), karty nástrojov s finančnými atribútmi a plánovač ReAct zohľadňujúci obmedzenia, limitovaný na päť krokov.
Kľúčové myšlienky
- Spustenie nie je úzkym miestom – úvaha nad výstupmi áno. GPT-4o má najvyššie Conditional Soft Score (CSS = 0,670), čo znamená, že dáva správne odpovede, keď úspešne zavolá nástroj, ale nástroje volá len v 22,7 % prípadov (TIR = 0,227). Qwen3-8B volá nástroje v 87,1 % prípadov, ale správnu odpoveď získa len v 40,4 % prípadov, keď sa volanie podarí.
- Nesúlad zámeru je dominantné zlyhanie súladu. Miera nesúladu zámeru (IMR) presahuje 50 % pri väčšine modelov, čo znamená, že agenti bežne vykonávajú transakčné volania, keď dotaz žiada len o vyhľadanie informácií. To je vážny problém v regulovaných finančných kontextoch.
- Vkladanie finančných atribútov pomáha súladu bez poškodenia schopností. Základné karty nástrojov FATR – s anotáciou čerstvosti, typu zámeru a regulačnej domény – znižujú volania so zastaranými dátami (TMR) a porušenia domén (DMR) bez výrazného zníženia miery volaní.
- Dotazy s viacerými nástrojmi odhaľujú medzeru spoľahlivosti. 129 dotazov s viacerými nástrojmi vyžaduje reťazenie volaní a prenášanie výstupov medzi krokmi; výkon výrazne klesá v porovnaní s prípadmi s jedným nástrojom, čo je v súlade so zisteniami z FinTrace a TheAgentCompany.
- Malé modely môžu viac volať, ale nie viac uvažovať. TIR 0,871 pre Qwen3-8B oproti 0,227 pre GPT-4o ukazuje, že menšie modely volajú unáhlene, ale CER (Conditional Execution Rate, t. j. TESR/TIR) 0,339 pre Qwen3-8B oproti 0,618 pre GPT-4o odhaľuje, že GPT-4o je oveľa presnejší, keď sa rozhodne zavolať nástroj.
Čo obstojí – a čo nie
Primárnym prínosom benchmarku je použitie skutočne živých, spustiteľných API, a je to podstatný prínos. Napodobnené API boli tajným nedostatkom benchmarkov používania nástrojov: 16 000 API v ToolLLM znie pôsobivo, kým si neuvedomíte, že hodnotenie používa LLM ako sudcu toho, či by volanie „fungovalo“. FinToolBench sa tomu vyhýba.
Metriky súladu (TMR, IMR, DMR) sú koncepčne správne – finanční agenti musia poznať rozdiel medzi získaním včerajšej záverečnej ceny a iniciovaním obchodu – ale opis toho, ako sú tieto klasifikácie vynucované, je v článku slabý. Nie je jasné, či ground-truth označenia typu zámeru (informačný vs. transakčný) overili právni alebo compliance odborníci, alebo ich jednoducho priradili autori datasetu. To má v praxi veľký význam.
Zoznam modelov je tiež zvláštne úzky: Doubao-Seed-1.6, Qwen3-8B, GLM-4.7-Flash a GPT-4o. Bez Claude Sonnet alebo Gemini 2.5, ktoré by boli prirodzeným porovnaním. Tabuľka výsledkov ukazuje GPT-4o ako odľahlú hodnotu s vysokou presnosťou a nízkym pokrytím; rád by som vedel, či sa správanie Claude pri používaní nástrojov blíži viac konzervatívnemu vzoru GPT-4o alebo agresívnemu vzoru Qwen3-8B.
Hodnotiaca sada 295 dotazov je podľa moderných štandardov benchmarkov malá. Pri 760 nástrojoch znamená miera pokrytia 295 dotazov, že väčšina nástrojov nie je nikdy testovaná. Článok neposkytuje štatistiky pokrytia podľa domén, čo znamená, že hlavné čísla môžu byť poháňané podmnožinou dobre pokrytých domén, ako sú akcie a makroekonomika.
Prečo je to dôležité pre finančnú AI
Beancount write-back agenti – akýkoľvek agent, ktorý volá bean-add, upravuje ledger súbor alebo sa pýta cez beanquery – čelia presne tým spôsobom zlyhania, ktoré FinToolBench odhaľuje. Problém nesúladu zámeru sa mapuje priamo: Beancount agent, ktorý vykoná zápis, keď sa používateľ pýtal na čítanie, má rovnaký podpis zlyhania ako porušenie IMR. Dimenzia čerstvosti sa mapuje na volanie zastaraného stavu ledgera, keď používateľ očakáva aktuálny zostatok.
Napätie medzi presnosťou a pokrytím (GPT-4o vs. Qwen3-8B) je tiež okamžite relevantné. Pre Beancount write-back by som výrazne uprednostnil konzervatívne správanie volaní GPT-4o – nízky TIR, vysoký CER a CSS – pred modelom s vysokou mierou volaní, ktorý často vykoná nesprávny nástroj. Nesprávne zápisy stoja oveľa viac ako žiadne operácie.
Prístup FATR k anotovaniu nástrojov atribútmi súladu namiesto spoliehania sa na to, že ich model odvodí sám, je dizajnový vzor, ktorý stojí za osvojenie. Obalenie Beancount CLI nástrojov explicitnými metadátami o tom, či je volanie len na čítanie alebo meniace, a či sa týka aktuálneho alebo archivovaného stavu ledgera, je rovnaká myšlienka aplikovaná v menšej mierke.
Čo čítať ďalej
- FinTrace (arXiv:2604.10015) – hodnotenie na úrovni trajektórií naprieč 34 kategóriami finančných úloh s 9 metrikami; priamo rozširuje hodnotenie jednotlivých volaní FinToolBench na viackrokové sekvencie a dolaďuje Qwen-3.5-9B pomocou DPO na zlepšenie medzikrokovej úvahy.
- FinMCP-Bench (arXiv:2603.24943) – 613 vzoriek cez 65 finančných nástrojov založených na MCP, testujúcich volania s jedným nástrojom, viacerými nástrojmi a viacnásobnými kolami; MCP rámec je priamo relevantný pre Beancount nástrojové rozhrania.
- ToolLLM (arXiv:2307.16789, ICLR 2024) – článok ToolBench, voči ktorému sa FinToolBench explicitne vymedzuje; pochopenie toho, čo mock-API základná línia môže a nemôže merať, objasňuje, koľko stojí skutočná spustiteľnosť FinToolBench.





