我不再信任 AI Agent 使用工具,于是造了一个守门人
来源:dev.to — 2026-08-13 — 9 min
📋 概述
作者用三个项目总结出一个教训:mock agent 会撒谎、单元测试会通过、演示看起来很干净,但一旦真实 agent 跑起来,一切都会崩。他坦言此前在 eval harness 里「现场测试是临时、后期才加上的,因为我开始担心单元测试和 mock agent 掩盖了真实的集成问题」。这次他反其道而行:零 mock agent,用 10 个框架的 83 个真实 agent,通过覆盖设计把 12 天的测试矩阵压缩到一个下午,并设置发布闸门——没有真实 agent 证明策略可行就不得发布。结果 2490 个测试全绿、83/83 agent 通过、成功发布到 PyPI。他同时指出,所有人都在竞相给 AI agent 更多工具,却几乎没人构建决定何时能使用这些工具的权限系统。
🔑 核心要点
- 三个项目得出同一教训:mock agent 会撒谎,单元测试通过不等于真实可用。
- 此前现场测试总是临到后期才补充,掩盖了真实集成问题。
- 这次反其道而行:零 mock agent,用 83 个真实 agent 覆盖 10 个框架。
- 覆盖设计把 12 天的测试矩阵压缩到一个下午。
- 发布闸门:没有真实 agent 证明策略可行就不得发布。结果 2490 测试全绿、83/83 通过。
- 大家都在竞相给 AI agent 更多工具,却几乎没人构建决定何时能用工具的权限系统。
💡 金句
单元测试和 mock agent 会隐藏真实的集成问题——只有真实 agent 才能证明策略可行。
👍 0
👎 0
← 返回 dev.to 首页