Перейти до основного вмісту

Mike Thrift

Менеджер з маркетингу

TAT-QA: Гібридний бенчмарк відповідей на запитання для аналізу фінансової звітності

TAT-QA — це бенчмарк із 16 552 запитань за контекстами фінансових звітів (таблиці + текст), який довів, що обґрунтування доказами, а не арифметика, є основним вузьким місцем у ШІ для фінансів; до 2024 року донастроєні 7B LLM досягли 83% F1, майже наздогнавши людський показник у 91%.

FinQA: Бенчмарк для вимірювання чисельних міркувань ШІ у фінансових звітах

FinQA (EMNLP 2021) зібрав 8 281 пару питань та відповідей зі звітів про прибутки компаній S&P 500, що потребують багатоетапних арифметичних програм. Нейронні моделі набрали 61% на момент випуску проти 91% у експертів-людей; точність падає до 22% у програмах з трьома або більше етапами. Режими збоїв — доменні константи, крос-модальне обґрунтування, довжина ланцюжка — безпосередньо відображають виклики, з якими сьогодні стикаються агенти Beancount.

FinanceBench: Чому RAG на основі векторних сховищ зазнає невдачі на реальних фінансових документах

FinanceBench оцінює 16 конфігурацій ШІ на основі 10 231 запитання з реальних звітів SEC; RAG із спільним векторним сховищем дає правильні відповіді лише у 19% випадків, і навіть GPT-4-Turbo з використанням фрагмента-оракула досягає лише 85% точності. Це свідчить про те, що саме чисельні міркування, а не пошук даних, є основним обмеженням для корпоративного фінансового ШІ.

DSPy: Заміна крихкого промпт-інжинірингу компільованими конвеєрами LLM

DSPy замінює ручне написання промптів декларативними сигнатурами та компілятором на основі метрик, підвищуючи точність Llama2-13b з 9,4% до 46,9% у математичних завданнях GSM8K та пропонуючи надійніший шлях для створення промислових конвеєрів ШІ у сфері фінансів.

LATS: Language Agent Tree Search — міркування, дія та планування в одному фреймворку

LATS (Language Agent Tree Search, ICML 2024) об'єднує ReAct, Tree of Thoughts та Reflexion в єдиний MCTS-фреймворк, досягаючи 92.7% pass@1 на HumanEval з GPT-4. Для git-бекеджих Beancount-бухгалтерських книг вимога відновлення стану, яка обмежує LATS у продакшені, тривіально задовольняється.

Self-RAG: Адаптивний пошук та самокритика для LLM

Self-RAG (ICLR 2024 Oral) навчає мовну модель вирішувати, коли здійснювати пошук, а потім оцінювати власні результати за допомогою чотирьох токенів рефлексії — досягаючи 55,8% на PopQA та 80,2 FactScore на біографіях, перевершуючи ChatGPT у п'яти тестах. Аналіз охоплює механізм, результати абляції, обмеження відтворюваності та наслідки для фінансових ШІ-агентів у книгах Beancount.

Voyager: бібліотеки навичок відкривають у 3,3 раза більше предметів

Постійна бібліотека коду навичок Voyager виявляє у 3,3 раза більше предметів Minecraft, ніж попередні SOTA без тонкого налаштування—це реєстр патернів повторного використання, необхідний агентам обліку.

AgentBench: Оцінювання LLM як агентів — уроки для надійності фінансового ШІ

AgentBench (Liu et al., ICLR 2024) оцінює 27 LLM у 8 інтерактивних середовищах — GPT-4 отримав 4.01 загалом проти 0.96 у найкращої моделі з відкритим кодом. Три домінуючі типи збоїв (перевищення ліміту завдань у 67.9% збоїв графів знань, помилки формату в 53.3% збоїв баз даних та недійсні дії) безпосередньо відображають ризики розгортання Beancount-агента зворотного запису на реальній книзі.

BloombergGPT та межі вузькоспеціалізованих LLM у фінансах

Bloomberg навчила LLM з 50 млрд параметрів на 569 млрд токенів фінансових даних і перевершила загальні моделі в бенчмарках аналізу настроїв та міркувань на основі таблиць — проте GPT-4 наздогнала її без жодного спеціалізованого фінансового донавчання. Що цей експеримент вартістю 10 млн доларів відкриває про компроміси претренінгу в конкретних доменах, токенізацію чисел та чому використання інструментів надійніше за внутрішню логіку моделі для бухгалтерських агентів.

AutoGen: Фреймворки мультиагентної взаємодії для ШІ у фінансах

AutoGen (Wu et al., 2023) представляє фреймворк мультиагентної взаємодії, де агенти на основі LLM обмінюються повідомленнями для виконання завдань; система з двох агентів підвищує точність бенчмарку MATH з 55% до 69%, а спеціалізований агент SafeGuard покращує виявлення небезпечного коду на цілих 35 пунктів F1 — результати, що безпосередньо застосовні до створення безпечних модульних конвеєрів автоматизації Beancount.

Gorilla: як навчання з урахуванням пошуку (Retriever-Aware Training) знижує рівень галюцинацій LLM API з 78% до 11%

Gorilla (Patil та ін., NeurIPS 2024) виконує тонке налаштування моделі LLaMA 7B за допомогою навчання з урахуванням пошуку (Retriever-Aware Training) на знайденій документації API, знижуючи частоту галюцинацій з 78% до 11% порівняно з GPT-4 zero-shot — це має пряме значення для фінансових ШІ-агентів зворотного запису, де помилкові назви рахунків або переплутані знаки є критичними помилками, а не просто незручностями.