
FinToolBench: Evaluando Agentes LLM en el Uso de Herramientas Financieras del Mundo Real
FinToolBench combina 760 herramientas API financieras en vivo con 295 consultas ejecutables para evaluar agentes LLM en tareas financieras reales — revelando que la tasa conservadora de invocación del 22.7% de GPT-4o produce mayor calidad de respuesta (CSS 0.670) que la agresiva TIR del 87.1% de Qwen3-8B, mientras que la discrepancia de intención supera el 50% en todos los modelos probados.





