我让 AI 规划 170 次变更,它每次都犯同样的 3 个错
来源:dev.to — 2026-09-17
📋 概述
作者搭了一个 PlannerCritic 引擎:一个 LLM 写计划,确定性门禁先按硬规则过滤,第二个 LLM 再评审,不收敛就升级给人。把它指向 40 个领域的 170 个真实变更规划目标,总共只花了 0.49 美元。结论不是「模型不行」,而是——模型从来不是变量,计划才是:所有失败都归入三类,门禁在 4.7 秒内跑完 1295 个测试,且零 LLM 调用。
🔑 核心要点
- 失败不是随机的,而是固定三类:跑到第 10 个目标就能看出规律。
- 未验证依赖(57 次阻断):计划声称某前提为真,却没有任何前置任务保证它。
- 不安全的顺序(46 次阻断):向量回填排在质量校验之前。
- 确定性门禁比换更大的模型更有效,而且成本几乎为零。
- 修不好的计划会被升级给人,而不是继续猜。
💡 金句
所有人都在争论哪个模型规划得最好,我跑了 170 个目标才发现——模型从来不是那个变量,计划才是。
👍 0
👎 0
← 返回 dev.to 首页