
WildToolBench: 실제 환경의 도구 사용에서 LLM의 세션 정확도가 15%를 넘지 못하는 이유
WildToolBench는 실제 사용자 과제 1,024건에서 어떤 LLM도 세션 정확도 15%를 넘지 못하며, 숨은 의도와 지시 전환이 가장 심각한 실패 유형이라고 밝힌다.
#technology
금융 AI 시스템과 관련된 기술 연구 및 소프트웨어 엔지니어링 주제

WildToolBench는 실제 사용자 과제 1,024건에서 어떤 LLM도 세션 정확도 15%를 넘지 못하며, 숨은 의도와 지시 전환이 가장 심각한 실패 유형이라고 밝힌다.

LLM은 답이 컨텍스트 중간에 있을 때 최대 20점 더 낮은 점수를 받으므로, 금융 RAG 파이프라인은 최상의 구절을 처음이나 끝에 배치해야 합니다.

OSWorld에 따르면 데스크톱 AI 에이전트는 실제 작업의 12.24%를 성공하고 인간은 72.36%를 성공하며, 실패의 75%는 추론이 아닌 시각운동 그라운딩에서 비롯됩니다.

StructRAG는 각 질의를 표, 그래프, 카탈로그, 알고리즘, 청크 구조로 라우팅해 GraphRAG를 28포인트 이기고 22배 더 빠르게 실행된다.

동일한 추론 토큰 예산에서 싱글 에이전트 LLM은 멀티 홉 추론에서 멀티 에이전트 시스템과 동등하거나 더 나은 성능을 보입니다—더 간단한 금융 에이전트 설계를 선호합니다.

Self-RAG는 언제 검색하고 스스로 결과를 채점할지 LLM이 결정하도록 학습시켜 PopQA에서 55.8%, FactScore에서 80.2를 기록하며 다섯 벤치마크에서 ChatGPT를 앞선다.

AgentBench는 GPT-4에 4.01점, 최고 오픈소스 LLM에 0.96점을 주었다. 이러한 실패는 실시간 원장에서 Beancount 기록 에이전트를 망가뜨리는 바로 그 요인이다.

MemGPT의 OS 스타일 메모리 계층은 GPT-4 다중 세션 채팅 정확도를 고정 컨텍스트의 32.1% 대비 92.5%로 끌어올립니다—다년간 원장 에이전트에 필요합니다.