
FinToolBench: Оцінювання LLM-агентів у реальному використанні фінансових інструментів
FinToolBench поєднує 760 живих фінансових API-інструментів із 295 виконуваними запитами, щоб оцінити LLM-агентів на реальних фінансових завданнях — показуючи, що консервативний показник викликів GPT-4o у 22,7% дає вищу якість відповідей (CSS 0,670), ніж агресивний TIR у 87,1% у Qwen3-8B, тоді як розбіжність намірів перевищує 50% у всіх протестованих моделей.





