跳转到主要内容

#technology

Technology

Technology research and software engineering topics relevant to financial AI systems

AgentBench:评估作为智能体的 LLM —— 对金融 AI 可靠性的启示

AgentBench(Liu 等人,ICLR 2024)在 8 个交互式环境中对 27 个 LLM 进行基准测试——GPT-4 综合得分 4.01,而最佳开源模型仅 0.96。三大主导失败模式(67.9% 的知识图谱失败源于超出任务限制、53.3% 的数据库失败源于格式错误、以及无效动作)直接对应在真实账本上部署 Beancount 写回智能体的风险。