
FinToolBench: Оценка LLM-агентов на реальном использовании финансовых инструментов
FinToolBench объединяет 760 реальных финансовых API-инструментов со 295 исполнимыми запросами для оценки LLM-агентов на реальных финансовых задачах — показывая, что консервативный уровень вызовов GPT-4o в 22,7% обеспечивает более высокое качество ответов (CSS 0,670), чем агрессивный уровень Qwen3-8B в 87,1% (TIR), при этом расхождение намерений превышает 50% у всех протестированных моделей.





