Към основното съдържание

Изследователски дневник

Отворени експерименти и открития от Bean Labs — изследователската инициатива Finance AI Agent на Beancount.io.

Chain-of-Thought Prompting: Компромиси между точност и пълнота за AI във финансите

Внимателен прочит на статията на Wei и кол. от 2022 г. за Chain-of-Thought и какво означава тя за AI във финансите — защо CoT повишава точността, но може да намали пълнотата при откриване на редки събития, защо прагът на мащаба е важен за производствените агенти и за какво трябва да внимава финансов екип, който строи върху LLM.

PHANTOM (NeurIPS 2025): Измерване на откриването на халюцинации в LLM при финансови документи

PHANTOM (NeurIPS 2025) е първият бенчмарк, който измерва откриването на халюцинации в LLM върху реални SEC документи при дължина на контекста до 30 000 токена. Qwen3-30B-A3B-Thinking води с F1=0.882; моделите от 7B постигат резултати близки до случайното отгатване — с директни последици за автономните счетоводни агенти.

Бенчмарк FinMaster: Защо LLM постигат 96% финансова грамотност, но само 3% при генериране на финансови отчети

FinMaster (arXiv:2505.13533) оценява o3-mini, Claude 3.7 Sonnet и DeepSeek-V3 в 183 финансови задачи — разкривайки, че моделите постигат 96% на финансова грамотност, но падат до 3% при генериране на отчети, като многоетапните консултантски задачи губят 21 пункта точност поради разпространение на грешки.

ReAct: Синергия между разсъждението и действието в езиковите модели

ReAct (Yao et al., ICLR 2023) редува разсъждения по верига от мисли с действия с инструменти в една траектория, превъзхождайки чистия CoT при проверка на факти и имитационното обучение при въплътени задачи с 34 процентни пункта. Този анализ разглежда режимите на отказ на статията — разсейване, предизвикано от търсене, и натрупващи се грешки — и какво означават те за автономни агенти, записващи обратно в Beancount счетоводни книги.

Toolformer: Самоконтролирано използване на инструменти и неговите граници за финансовите ИИ

Подробно разглеждане на Toolformer (Meta AI, NeurIPS 2023): как самоконтролираното обучение, филтрирано по перплекситет, учи модел с 6.7B параметри да извиква външни API, къде той превъзхожда GPT-3 175B на аритметични показатели и защо неговата едноетапна архитектура не може да поддържа верижни извиквания на инструменти, необходими за структурирани счетоводни операции.

FinBen: Бенчмарк на LLM върху 36 финансови задачи — последици за счетоводния ИИ

FinBen оценява 15 LLM върху 36 финансови набора от данни на NeurIPS 2024, като установява, че GPT-4 достига 0.63 точно съвпадение при числови QA и 0.54 при прогнозиране на движения на акции — близо до случайното. Ето какво означават тези числа за изграждането на надежден счетоводен агент върху Beancount ledger.