
面向 LLM 智能体的不确定性感知委派:何时从小型模型切换到大型模型
ReDAct 默认运行小型模型,仅在 Token 级困惑度显示不确定性时才上报给昂贵的大型模型。在匹配或超过 GPT-5.2 准确率的同时,实现了 64% 的成本节省 —— 这一模式可直接应用于 Beancount 交易分类智能体。
#decision-making

ReDAct 默认运行小型模型,仅在 Token 级困惑度显示不确定性时才上报给昂贵的大型模型。在匹配或超过 GPT-5.2 准确率的同时,实现了 64% 的成本节省 —— 这一模式可直接应用于 Beancount 交易分类智能体。

InvestorBench:Qwen2.5-72B以46.15%的CR引领股票交易;金融调优的Palmyra-Fin在股票上适得其反——规模胜过领域微调。

LATS(语言智能体树搜索,ICML 2024)将ReAct、思维树和Reflexion统一到一个MCTS框架中,在HumanEval上使用GPT-4达到92.7%的pass@1。 对于基于git的Beancount账本,限制LATS在生产环境中应用的状态回滚要求可以轻松满足。

思维树 (ToT) 在 24 点游戏中实现了 74% 的成功率,而标准的 GPT-4 CoT 仅为 4%。它通过将大模型推理组织成具有剪枝和回溯功能的决策树来实现这一目标,这对 Beancount 工作流中的多步骤财务分类和税务优化具有直接意义。