
FinToolBench: Bewertung von LLM-Agenten bei der realen Nutzung von Finanztools
FinToolBench kombiniert 760 Live-Finanz-API-Tools mit 295 ausführbaren Abfragen, um LLM-Agenten bei realen Finanzaufgaben zu bewerten – und zeigt, dass GPT-4os konservative Aufrufrate von 22,7% zu höherer Antwortqualität (CSS 0,670) führt als Qwen3-8Bs aggressive 87,1% TIR, während die Intent-Diskrepanz bei allen getesteten Modellen über 50% liegt.





