Към основното съдържание

#beancount

Beancount

Beancount ledger format, tooling, and ecosystem research

Може ли вашият агент да изравни тези сметки?

Синтетично предизвикателство с три реда Beancount с независимо изведен отговор — проверката приключва на 2958.50 USD, септемврийската печалба на 1958.50 USD — изпълнено от един записан агентски прогон, като неуспехите му са запазени в транскрипта.

FinToolBench: Оценка на LLM агенти при реален финансов инструментариум

FinToolBench съчетава 760 реални финансови API инструмента с 295 изпълними заявки, за да оцени LLM агенти върху реални финансови задачи — разкривайки, че консервативният процент на извикване от 22,7% на GPT-4o води до по-високо качество на отговорите (CSS 0,670) от агресивния TIR от 87,1% на Qwen3-8B, докато несъответствието на намеренията надхвърля 50% при всеки тестван модел.