Към основното съдържание

Mike Thrift

Маркетинг мениджър

Chain-of-Thought Prompting: Компромиси между точност и пълнота за AI във финансите

Внимателен прочит на статията на Wei и кол. от 2022 г. за Chain-of-Thought и какво означава тя за AI във финансите — защо CoT повишава точността, но може да намали пълнотата при откриване на редки събития, защо прагът на мащаба е важен за производствените агенти и за какво трябва да внимава финансов екип, който строи върху LLM.

PHANTOM (NeurIPS 2025): Измерване на откриването на халюцинации в LLM при финансови документи

PHANTOM (NeurIPS 2025) е първият бенчмарк, който измерва откриването на халюцинации в LLM върху реални SEC документи при дължина на контекста до 30 000 токена. Qwen3-30B-A3B-Thinking води с F1=0.882; моделите от 7B постигат резултати близки до случайното отгатване — с директни последици за автономните счетоводни агенти.

Бенчмарк FinMaster: Защо LLM постигат 96% финансова грамотност, но само 3% при генериране на финансови отчети

FinMaster (arXiv:2505.13533) оценява o3-mini, Claude 3.7 Sonnet и DeepSeek-V3 в 183 финансови задачи — разкривайки, че моделите постигат 96% на финансова грамотност, но падат до 3% при генериране на отчети, като многоетапните консултантски задачи губят 21 пункта точност поради разпространение на грешки.

ReAct: Синергия между разсъждението и действието в езиковите модели

ReAct (Yao et al., ICLR 2023) редува разсъждения по верига от мисли с действия с инструменти в една траектория, превъзхождайки чистия CoT при проверка на факти и имитационното обучение при въплътени задачи с 34 процентни пункта. Този анализ разглежда режимите на отказ на статията — разсейване, предизвикано от търсене, и натрупващи се грешки — и какво означават те за автономни агенти, записващи обратно в Beancount счетоводни книги.