Към основното съдържание

#technology

Technology

Technology research and software engineering topics relevant to financial AI systems

AgentBench: Оценка на LLM като агенти — Уроци за надеждността на финансовия ИИ

AgentBench (Liu et al., ICLR 2024) оценява 27 LLM в 8 интерактивни среди — GPT-4 постига 4.01 общо, докато най-добрият модел с отворен код получава 0.96. Трите доминиращи режима на отказ (превишен лимит на задачите в 67.9% от отказите при граф на знанието, грешки във формата в 53.3% от отказите при база данни и невалидни действия) се пренасят директно върху рисковете при внедряване на Beancount агент за запис върху реална сметководна книга.