
FinToolBench: Avaluació d'agents LLM en l'ús d'eines financeres del món real
FinToolBench combina 760 eines financeres API en directe amb 295 consultes executables per avaluar agents LLM en tasques financeres reals — revelant que la taxa d'invocació conservadora del 22,7% de GPT-4o produeix una qualitat de resposta més alta (CSS 0,670) que la TIR agressiva del 87,1% de Qwen3-8B, mentre que el desajust d'intenció supera el 50% en tots els models provats.





