Перейти к основному содержимому

#technology

Технологии

Технологические исследования и разработка ПО для финансовых ИИ-систем

WildToolBench: Почему ни одна LLM не превышает 15% точности сессии в реальных сценариях использования инструментов

WildToolBench обнаруживает, что ни одна LLM не превышает 15% точности сессий на 1 024 задачах реальных пользователей; скрытые намерения и смена инструкций — худшие сбои.

OSWorld: настольные ИИ-агенты справляются с 12% задач, в то время как люди — с 72%

OSWorld обнаруживает, что настольные ИИ-агенты справляются с 12,24% реальных задач против 72,36% у людей, причём 75% сбоев из-за зрительно-моторной привязки, а не рассуждений.

Single-Agent: сравнение с MAS на многошаговых задачах при равном количестве токенов

При равных бюджетах на токены мышления одностраничные LLM-агенты сравнимы или превосходят многоагентные системы в многошаговых рассуждениях — отдавайте предпочтение более простым конструкциям финансовых агентов.