我用 4 个模型拯救自改进智能体,全部失败
来源:dev.to — 2026-09-03
📋 概述
作者为自改进智能体做了两个版本,曾坚信瓶颈是模型能力:4B 太小、24B 更强、30B 或许行……结果 4 个模型、4150 次 LLM 调用、修掉 31+26 个 bug 后,可晋升的编辑数为零。数据无情地揭穿了「换更大模型」的理论:Qwen 4B、Mistral 24B、Qwen 30B、Llama 1B 全部卡在同一处局部最优——它们都在同一片 prompt 区域(计费消歧、紧急度措辞、输出格式)打转,从没跳到不同的失败族。真正的瓶颈不是模型而是搜索机制:一次只生成一个候选、没有探索步骤、没有便宜的预评估就投入昂贵 A/B 测试。v0.3.0 的解法因此是结构性的:先生成多个多样化候选、在失败批次上廉价打分、只 A/B 最好的那个。
🔑 核心要点
- 4 个模型无一产生可晋升的编辑:Qwen 4B 是噪音(每次迭代随机)、Mistral 24B 有真实方向信号(5 次中 3 次正 delta)但从未越过 p<0.05、Qwen 30B 只加延迟不加改进、Llama 1B 连候选都产不出
- 最扎心的暗模式:每个模型都被困在同一局部区域(计费规则、紧急度措辞、输出格式),Mistral 只是把同一个「紧急应覆盖安全」概念换着措辞,却称之为探索
- 失败模式异常稳定:多标签分类、歧义的「other」、对「billing」的过度关键词索引——两版发布、四个模型之间同一批失败原样重现,而没人提出「强制逗号分隔输出」这个显然能立刻移动 3 个任务的编辑
- 数据明确指向局部最优:分析器一次生成一个提议、A/B 被拒、下轮再提同款失败的微调版——没有跳出机制的搜索循环,任何模型规模都救不了
- 统计天花板雪上加霜:40 任务语料上若要可靠越过 p<0.05 需移动 7-10 个任务,而分析器从没移动超过 5 个
- 「try a bigger model」该何时停止?当从 1B 到 30B 的四个模型产出相同结果时——瓶颈已明确是生成单候选、无探索、无廉价预评估的搜索策略
💡 金句
我们证明了管道、证明了安全、证明了什么行不通——这就是构建什么行得通的基础。
👍 0
👎 0
← 返回 dev.to 首页