Перейти к основному содержимому

Mike Thrift

Менеджер по маркетингу

TAT-QA: Гибридный бенчмарк для ответов на вопросы и логических выводов на основе таблиц и текста в финансовых отчетах

TAT-QA — это бенчмарк из 16 552 вопросов по гибридным контекстам финансовых отчетов (таблица + текст), который показал, что обоснование доказательств (grounding), а не арифметика, является основным узким местом в финансовом ИИ; к 2024 году дообученные LLM на 7 млрд параметров достигли 83% F1, сократив большую часть разрыва по сравнению с человеческим порогом в 91%.

FinQA: бенчмарк для измерения численного мышления ИИ в финансовых отчетах

В рамках проекта FinQA (EMNLP 2021) была создана база из 8 281 пары вопросов и ответов на основе отчетов о доходах компаний из индекса S&P 500, требующих выполнения многошаговых арифметических программ. На момент выпуска нейросетевые модели набирали 61% баллов против 91% у экспертов-людей; точность падает до 22% в программах из трех и более шагов. Типичные ошибки — использование доменных констант, кросс-модальная привязка, длина цепочки рассуждений — напрямую отражают проблемы, с которыми сегодня сталкиваются агенты Beancount.

FinanceBench: почему RAG на векторных хранилищах не справляется с реальными финансовыми документами

FinanceBench оценивает 16 конфигураций ИИ на 10 231 вопросе из реальных отчетов SEC; RAG с общим векторным хранилищем дает правильные ответы лишь в 19% случаев, а GPT-4-Turbo даже с «оракулом» достигает точности только в 85%. Это доказывает, что численные рассуждения, а не поиск данных, являются основным ограничением для корпоративного финансового ИИ.

DSPy: замена хрупкого промпт-инжиниринга скомпилированными конвейерами LLM

DSPy заменяет написанные вручную строки промптов декларативными сигнатурами и компилятором на основе метрик, что повышает точность Llama2-13b на математических задачах GSM8K с 9,4% до 46,9% и предлагает более устойчивый путь для промышленных ИИ-конвейеров в сфере финансов.

LATS: Language Agent Tree Search — рассуждение, действие и планирование в одном фреймворке

LATS (Language Agent Tree Search, ICML 2024) объединяет ReAct, Tree of Thoughts и Reflexion в единый MCTS-фреймворк, достигая 92,7% pass@1 на HumanEval с GPT-4. Для git-связанных Beancount-бухгалтерских книг требование отката состояния, которое ограничивает LATS в продакшене, тривиально выполняется.

Self-RAG: адаптивный поиск и самокритика для LLM

Self-RAG (ICLR 2024 Oral) обучает языковую модель решать, когда обращаться к поиску, а затем оценивать собственные результаты с помощью четырех токенов рефлексии — достигая 55,8% на PopQA и 80,2 FactScore на биографиях, опережая ChatGPT в пяти бенчмарках. Анализ охватывает механизм, результаты абляции, ограничения воспроизводимости и последствия для финансовых ИИ-агентов, работающих с гроссбухами Beancount.

Voyager: библиотеки навыков открывают в 3,3 раза больше предметов

Постоянная библиотека навыков кода Voyager обнаруживает в 3,3 раза больше предметов Minecraft, чем предыдущий SOTA без тонкой настройки — реестр повторного использования, необходимый агентам журнала.

AgentBench: Оценка LLM как агентов — уроки для надежности финансового ИИ

AgentBench (Liu и др., ICLR 2024) тестирует 27 LLM в 8 интерактивных средах — GPT-4 набрал 4.01 в целом против 0.96 у лучшей модели с открытым исходным кодом. Три доминирующих типа сбоев (превышение лимита задач в 67.9% сбоев графа знаний, ошибки формата в 53.3% сбоев баз данных и недопустимые действия) напрямую отражают риски развертывания агента записи в Beancount на реальном реестре.

BloombergGPT и пределы специализированных LLM в сфере финансов

Компания Bloomberg обучила LLM с 50 млрд параметров на 569 млрд токенов финансовых данных и обошла универсальные модели в бенчмарках на анализ настроений и табличное мышление — однако затем GPT-4 сравнялась с ней без специального дообучения на финансах. Что этот эксперимент стоимостью 10 млн долларов говорит о компромиссах предварительного обучения на конкретной предметной области, токенизации чисел и о том, почему использование инструментов надежнее внутренних механизмов модели для бухгалтерских агентов.

AutoGen: Фреймворки многоагентного диалога для ИИ в финансах

AutoGen (Wu et al., 2023) представляет собой фреймворк многоагентного диалога, где агенты на базе LLM обмениваются сообщениями для выполнения задач; система из двух агентов повышает точность бенчмарка MATH с 55% до 69%, а специализированный агент SafeGuard улучшает обнаружение небезопасного кода до 35 пунктов F1 — результаты, применимые для создания безопасных модульных конвейеров автоматизации Beancount.

Gorilla: Как обучение с учетом поиска (RAT) снижает уровень галлюцинаций LLM API с 78% до 11%

Gorilla (Patil et al., NeurIPS 2024) дообучает модель LLaMA 7B с помощью метода Retriever-Aware Training на найденной документации API, снижая уровень галлюцинаций с 78% до 11% по сравнению с GPT-4 zero-shot. Это имеет прямое значение для ИИ-агентов в сфере финансов, где неверные названия счетов или перепутанные знаки операций являются критическими ошибками.