
DIN-SQL: GPT-4 улучшает точность на Spider с 67,4% до 85,3%
DIN-SQL повышает точность выполнения GPT-4 на Spider с 67,4% до 85,3% за счет этапов связывания схемы и самокоррекции — та же декомпозиция применима к BQL в Beancount.

DIN-SQL повышает точность выполнения GPT-4 на Spider с 67,4% до 85,3% за счет этапов связывания схемы и самокоррекции — та же декомпозиция применима к BQL в Beancount.

На BIRD GPT-4 достигает 54,89% точности выполнения с подсказками по домену и 34,88% без них — разрыв в 20 пунктов, который должен закрыть любой интерфейс Beancount NL→BQL.

Исследователи из CMU и Университета штата Северная Каролина предлагают использовать системно-теоретический анализ процессов (STPA) и расширенный возможностями протокол Model Context Protocol для вывода формальных спецификаций безопасности использования инструментов LLM-агентами, с верификацией на базе Alloy, демонстрирующей отсутствие небезопасных потоков в кейсе планирования календаря.

GraphRAG от Microsoft показывает 72–83% преимуществ в осмыслении над векторным RAG; аудит 2025 года их устраняет после исправления смещения судьи — осторожность для QA в многодокументных бухгалтерских книгах.

FinAuditing tests 13 LLMs zero-shot on 1,102 real SEC XBRL filing instances; top scores are 13.86% on financial math verification and 12.42% on concept retrieval—results that directly bound what AI accounting tools can be trusted to automate without external tooling.

InvestorBench: Qwen2.5-72B лидирует в торговле акциями с CR 46,15%; финансово настроенная Palmyra-Fin дает обратный эффект на акциях — размер превосходит отраслевую тонкую настройку.

StructRAG (ICLR 2025) направляет каждый запрос к соответствующему типу структуры — таблице, графу, каталогу, алгоритму или фрагменту текста — перед этапом рассуждения. Метод набрал на 28 пунктов больше, чем GraphRAG в бенчмарке Loong, работая при этом в 22 раза быстрее, причем один только маршрутизатор, обученный с помощью DPO, обеспечил прирост точности в 15 пунктов.

При равных бюджетах на токены мышления одностраничные LLM-агенты сравнимы или превосходят многоагентные системы в многошаговых рассуждениях — отдавайте предпочтение более простым конструкциям финансовых агентов.

M3MAD-Bench проводит стресс-тестирование многоагентных дебатов на 9 моделях в 5 областях и мультимодальных условиях. Выяснилось, что «Коллективное заблуждение» вызывает 65% сбоев, состязательные дебаты снижают точность на величину до 12,8%, а метод Self-Consistency обычно достигает сопоставимой точности при меньших затратах токенов.

AGrail (ACL 2025) представляет кооперативную систему защиты из двух LLM, которая адаптирует проверки безопасности во время вывода с помощью адаптации во время теста (TTA), достигая 0% успеха атак через промпт-инъекции и сохраняя 95,6% легитимных действий в Safe-OS — в то время как GuardAgent и LLaMA-Guard блокируют до 49,2% нормальных действий.

ShieldAgent (ICML 2025) заменяет гардрейлы на базе LLM вероятностными логическими схемами, построенными на марковских сетях логики, достигая точности 90,4% при атаках на агентов с сокращением количества вызовов API на 64,7% — и что это значит для верифицируемой безопасности в финансовых ИИ-системах.

Atlas (JMLR 2023) достигает точности 42,4% на Natural Questions всего с 64 обучающими примерами — превосходя PaLM 540B на 3 пункта, используя 11 млрд параметров — за счет совместного преобучения плотного ретривера на базе Contriever с ридером T5 Fusion-in-Decoder. Анализ охватывает пределы точности поиска, инфраструктурные затраты на индекс объемом 587 ГБ и значение для QA-систем бухгалтерских журналов Beancount.