Перейти до основного вмісту

#technology

Технології

Технологічні дослідження та інженерія програмного забезпечення для фінансових ШІ-систем

WildToolBench: Чому жодна LLM не перевищує 15% точності сесії при реальному використанні інструментів

WildToolBench: жодна LLM не перевищує 15% сесійної точності на 1 024 завданнях реальних користувачів, а найгостріші збої — прихований намір і переходи інструкцій.

Загублені посередині: упередженість щодо позиції в LLM та її вплив на ШІ у сфері фінансів

LLM набирають до 20 балів менше, коли відповідь міститься в середині контексту, тож фінансові RAG-конвеєри мають розміщувати найкращі уривки першими або останніми.

OSWorld: ШІ-агенти для робочого столу успішно виконують 12% завдань, тоді як люди — 72%

OSWorld виявляє, що агенти робочого столу успішні в 12,24% реальних завдань проти 72,36% у людей, причому 75% збоїв спричинено зорово-моторним заземленням, а не міркуванням.

Один агент: дорівнює MAS на багатокрокових завданнях за однакової кількості токенів

За однакового бюджету токенів мислення один агент LLM дорівнює або перевершує мультиагентні системи у багатокрокових міркуваннях — обирайте простіші дизайни фінансових агентів.