dev.to | 📄 原文链接 | 2026-09-04 收录

我用 4 个模型拯救自改进智能体,全部失败

来源:dev.to — 2026-09-03

📋 概述

作者为自改进智能体做了两个版本,曾坚信瓶颈是模型能力:4B 太小、24B 更强、30B 或许行……结果 4 个模型、4150 次 LLM 调用、修掉 31+26 个 bug 后,可晋升的编辑数为零。数据无情地揭穿了「换更大模型」的理论:Qwen 4B、Mistral 24B、Qwen 30B、Llama 1B 全部卡在同一处局部最优——它们都在同一片 prompt 区域(计费消歧、紧急度措辞、输出格式)打转,从没跳到不同的失败族。真正的瓶颈不是模型而是搜索机制:一次只生成一个候选、没有探索步骤、没有便宜的预评估就投入昂贵 A/B 测试。v0.3.0 的解法因此是结构性的:先生成多个多样化候选、在失败批次上廉价打分、只 A/B 最好的那个。

🔑 核心要点

💡 金句

我们证明了管道、证明了安全、证明了什么行不通——这就是构建什么行得通的基础。
← 返回 dev.to 首页