
FinToolBench: Valutare gli Agenti LLM sull'Uso Reale di Strumenti Finanziari
FinToolBench abbina 760 API finanziarie in tempo reale a 295 query eseguibili per valutare gli agenti LLM su compiti finanziari reali — rivelando che il tasso di invocazione conservativo del 22,7% di GPT-4o produce una qualità delle risposte superiore (CSS 0,670) rispetto al TIR aggressivo dell'87,1% di Qwen3-8B, mentre la mancata corrispondenza dell'intento supera il 50% in ogni modello testato.





