
FinToolBench: LLM-agenten evalueren op realistisch financieel toolgebruik
FinToolBench koppelt 760 live financiële API-tools aan 295 uitvoerbare queries om LLM-agenten te benchmarken op echte financiële taken — en onthult dat GPT-4o's conservatieve 22,7% aanroeppercentage een hogere antwoordkwaliteit oplevert (CSS 0,670) dan Qwen3-8B's agressieve 87,1% TIR, terwijl intentie-mismatch bij elk getest model boven de 50% ligt.





