Перейти к основному содержимому

#technology

Technology

Technology research and software engineering topics relevant to financial AI systems

WildToolBench: Почему ни одна LLM не превышает 15% точности сессии в реальных сценариях использования инструментов

WildToolBench (ICLR 2026) оценивает 57 LLM на 1024 задачах, основанных на реальном поведении пользователей — ни одна модель не превышает 15% точности сессии, при этом композиционная оркестрация, скрытые намерения и переходы между инструкциями являются тремя наиболее критичными режимами отказа.

Затерянные посередине: позиционное смещение в LLM и его влияние на финансовый ИИ

В статье TACL 2024 года Лю и др. показывают, что LLM работают на 20 пунктов хуже с информацией, скрытой в середине длинного контекста — U-образная деградация затрагивает все протестированные модели, включая Claude-1.3-100K — с конкретными выводами о том, как пайплайны RAG должны упорядочивать извлеченные фрагменты в финансовых и бухгалтерских приложениях.

OSWorld: настольные ИИ-агенты справляются с 12% задач, в то время как люди — с 72%

OSWorld (NeurIPS 2024) тестирует мультимодальных ИИ-агентов на 369 реальных настольных задачах в Ubuntu, Windows и macOS. Выявлен разрыв в 60 процентных пунктов между лучшей моделью (12,24%) и эффективностью человека (72,36%), при этом 75% неудач связаны с ошибками визуально-моторного заземления, а не сбоями в рассуждениях.

StructRAG (ICLR 2025): выбор правильной структуры документа превосходит GraphRAG на 28 пунктов

StructRAG (ICLR 2025) направляет каждый запрос к соответствующему типу структуры — таблице, графу, каталогу, алгоритму или фрагменту текста — перед этапом рассуждения. Метод набрал на 28 пунктов больше, чем GraphRAG в бенчмарке Loong, работая при этом в 22 раза быстрее, причем один только маршрутизатор, обученный с помощью DPO, обеспечил прирост точности в 15 пунктов.

Single-Agent: сравнение с MAS на многошаговых задачах при равном количестве токенов

При равных бюджетах на токены мышления одностраничные LLM-агенты сравнимы или превосходят многоагентные системы в многошаговых рассуждениях — отдавайте предпочтение более простым конструкциям финансовых агентов.

Self-RAG: адаптивный поиск и самокритика для LLM

Self-RAG (ICLR 2024 Oral) обучает языковую модель решать, когда обращаться к поиску, а затем оценивать собственные результаты с помощью четырех токенов рефлексии — достигая 55,8% на PopQA и 80,2 FactScore на биографиях, опережая ChatGPT в пяти бенчмарках. Анализ охватывает механизм, результаты абляции, ограничения воспроизводимости и последствия для финансовых ИИ-агентов, работающих с гроссбухами Beancount.

AgentBench: Оценка LLM как агентов — уроки для надежности финансового ИИ

AgentBench (Liu и др., ICLR 2024) тестирует 27 LLM в 8 интерактивных средах — GPT-4 набрал 4.01 в целом против 0.96 у лучшей модели с открытым исходным кодом. Три доминирующих типа сбоев (превышение лимита задач в 67.9% сбоев графа знаний, ошибки формата в 53.3% сбоев баз данных и недопустимые действия) напрямую отражают риски развертывания агента записи в Beancount на реальном реестре.