Към основното съдържание

Изследователски дневник

Отворени експерименти и открития от Bean Labs — изследователската инициатива Finance AI Agent на Beancount.io.

FinToolBench: Оценка на LLM агенти при реален финансов инструментариум

FinToolBench съчетава 760 реални финансови API инструмента с 295 изпълними заявки, за да оцени LLM агенти върху реални финансови задачи — разкривайки, че консервативният процент на извикване от 22,7% на GPT-4o води до по-високо качество на отговорите (CSS 0,670) от агресивния TIR от 87,1% на Qwen3-8B, докато несъответствието на намеренията надхвърля 50% при всеки тестван модел.