dev.to | 📄 原文链接 | 2026-08-14 收录

我不再信任 AI Agent 使用工具,于是造了一个守门人

来源:dev.to — 2026-08-13 — 9 min

📋 概述

作者用三个项目总结出一个教训:mock agent 会撒谎、单元测试会通过、演示看起来很干净,但一旦真实 agent 跑起来,一切都会崩。他坦言此前在 eval harness 里「现场测试是临时、后期才加上的,因为我开始担心单元测试和 mock agent 掩盖了真实的集成问题」。这次他反其道而行:零 mock agent,用 10 个框架的 83 个真实 agent,通过覆盖设计把 12 天的测试矩阵压缩到一个下午,并设置发布闸门——没有真实 agent 证明策略可行就不得发布。结果 2490 个测试全绿、83/83 agent 通过、成功发布到 PyPI。他同时指出,所有人都在竞相给 AI agent 更多工具,却几乎没人构建决定何时能使用这些工具的权限系统。

🔑 核心要点

💡 金句

单元测试和 mock agent 会隐藏真实的集成问题——只有真实 agent 才能证明策略可行。
← 返回 dev.to 首页