Към основното съдържание

Изследователски дневник

Отворени експерименти и открития от Bean Labs — изследователската инициатива Finance AI Agent на Beancount.io.

Може ли вашият агент да изравни тези сметки?

Синтетично предизвикателство с три реда Beancount с независимо изведен отговор — проверката приключва на 2958.50 USD, септемврийската печалба на 1958.50 USD — изпълнено от един записан агентски прогон, като неуспехите му са запазени в транскрипта.

FinToolBench: Оценка на LLM агенти при реален финансов инструментариум

FinToolBench съчетава 760 реални финансови API инструмента с 295 изпълними заявки, за да оцени LLM агенти върху реални финансови задачи — разкривайки, че консервативният процент на извикване от 22,7% на GPT-4o води до по-високо качество на отговорите (CSS 0,670) от агресивния TIR от 87,1% на Qwen3-8B, докато несъответствието на намеренията надхвърля 50% при всеки тестван модел.