我做了两套智能体系统,各自证明了对方是错的
来源:dev.to — 2026-09-27
📋 概述
作者做了两个引擎。PlannerCritic 让一个模型写计划、另一个模型批判,在有限轮次内反复修订直到收敛或升级给人类;另一个引擎让两个模型就一个 pull request 展开辩论。结果很有意思——每一套都恰好在对方被设计出来要防的那种方式上失败了,而正因如此,他才愿意相信其中任何一套。第一版他把「对抗性」写进提示词,希望批判者更严格,结果批判者开始以「不够详尽」为由否决一切,这是无用的判决;他只好把严重性契约从提示词里搬出来,放进代码里的一个 frozenset,让它无法漂移。
🔑 核心要点
- 把安全寄托在提示词上,两套系统会以同样的方式失效:行为约束必须落到代码里。
- PlannerCritic 的实测数据极其难看:标签翻转率 1.0、证据漂移率 1.0,同一输入每次都换判决。
- 用「对抗性」提示词加强批判者反而失控,它开始以「不够详尽」否决所有计划,这种判决毫无信息量。
- 作者的方法论是:正因为每套系统都在对方设计的防线上翻车,才值得同时保留。
💡 金句
每一套都恰好在对方被设计出来预防的地方失败了,而这正是我愿意相信其中任何一套的原因。
👍 0
👎 0
← 返回 dev.to 首页