Thought 树与 MCTS:当你不让模型只猜一次,会发生什么
来源:dev.to — 2026-09-05
📋 概述
作者用清晰的分层讲解 ToT(思维树)与 MCTS(蒙特卡洛树搜索)式的 LLM 推理。多数 LLM 应用架构是 prompt→LLM→answer 的单次生成,一旦中途某个错误步骤被定下,下游全建立在它之上。ToT 把推理从「generate→continue→continue」改成「propose→evaluate→branch→explore→backtrack→commit」:中间思考成为可搜索的状态而非一串 token。Yao 2023 的 Game of 24 实验里 GPT-4 的 chain-of-thought 基线只解出约 4%,ToT 达 74%——搜索能弥补单次采样推理轨迹的脆弱。真正重要的是把推理时的算力分配到最有价值的候选路径上。
🔑 核心要点
- ToT 相比普通 Chain of Thought 的本质是把中间推理当作可搜索状态:不再是 x0→x1→…→answer 的单线,而是树状分叉、评估、回溯,模型既是 proposal 机制也是启发式
- 标志性数据:Game of 24 里 GPT-4 的 CoT 基线仅解约 4%,ToT 流程达 74%——搜索弥补了单条采样推理轨迹的脆弱,概念远大于具体数字
- AlphaGo 是正确的心智模型:突破不是「神经网络变无限聪明」,而是「系统学会把算力花在正确的备选上」——对一个已蕴含巨量知识的 LLM,问题变成如何在推理时分配算力
- 一个 node 不是单个 token,而是继续推理所需的一切(方程/假设/候选/剩余约束,或代码里的假设/实现/测试结果/未解 bug),求值器甚至可以是环境本身而非另一个 LLM
- 代价是搜索把推理成本乘大:8 个候选 × 4 层 × 2 次评估轻松把一次调用变几十次,约 10 倍 token 预算——所以要点是「别到处搜索」,用路由策略把难题才送进 ToT/MCTS
💡 金句
不要在所有地方都做搜索——用一个路由策略:简单问题走普通解码,中等走自洽或小 beam,难题走思维树,又难又可验证的才用 MCTS 加外部求值器。
👍 0
👎 0
← 返回 dev.to 首页