Към основното съдържание

#accounting

Accounting

Accounting methods, workflows, and automation research

Може ли вашият агент да изравни тези сметки?

Синтетично предизвикателство с три реда Beancount с независимо изведен отговор — проверката приключва на 2958.50 USD, септемврийската печалба на 1958.50 USD — изпълнено от един записан агентски прогон, като неуспехите му са запазени в транскрипта.

Конституционен ИИ за счетоводни агенти: RLAIF, правила за политиките и рискове от Гудхартинг

Документът на Anthropic за конституционен ИИ (Bai et al., 2022) обучава LLM да следват правила, използвайки генерирана от ИИ обратна връзка, вместо човешки етикети за вреда. Този изследователски запис разглежда как RLAIF тръбопроводът критика-преразглеждане-предпочитание се пренася върху безопасността при запис за автономни Beancount ledger агенти — и как изглеждат Гудхартингът, калибрационните грешки и рисковете от двойна употреба, когато „конституцията“ е сметкоплан вместо етичен набор от правила.

Бенчмарк FinMaster: Защо LLM постигат 96% финансова грамотност, но само 3% при генериране на финансови отчети

FinMaster (arXiv:2505.13533) оценява o3-mini, Claude 3.7 Sonnet и DeepSeek-V3 в 183 финансови задачи — разкривайки, че моделите постигат 96% на финансова грамотност, но падат до 3% при генериране на отчети, като многоетапните консултантски задачи губят 21 пункта точност поради разпространение на грешки.