会行动的智能体需要刹车,而不只是大脑
来源:dev.to — 2026-09-03
📋 概述
过去两年整个行业都在赛跑让智能体更聪明——更好的推理、更长的上下文、更多的工具、更高的自主性,却几乎没有人花时间让它们安全地放手去行动。作者点破:一旦智能体从只说话变成真做事,更强大的模型并不会更有用,反而更危险——它犯错不是变少,而是更快、更自信、更让人信服。文章把「刹车」放在架构而非模型里,给出四层控制:按爆炸半径分级的人工审批门、一个能真正说不的评审(并且要持续证明它还能拒绝)、每条实质动作都留痕的审计轨迹,以及即便前面全失灵也能兜底的硬性上限。核心判断是:可控制性才是智能体系统的分水岭。
🔑 核心要点
- 让智能体更聪明与让它安全地行动是两个不同问题,更强的模型犯错只会更快更自信
- 聊天说错一句毫无代价,而一次错误的 DELETE、一封已发的邮件都不可撤销
- 智能体完成错误动作却上报成功,监控一片绿色——「它工作了」和「它做对了」是两回事
- 审批门应按爆炸半径分级而非一律卡死,全卡只会把人训练成盲目盖章的机器
- 从未见它失败过的评审与什么都放行的橡皮图章无法区分,须定期用已知坏动作证明拒绝仍可达
- 速率、花费、作用域、迭代次数等硬上限不依赖智能体判断对错,它们是墙,墙撑得住
💡 金句
一个从未被测试过的刹车不是刹车,它只是一个长得像刹车的物件。
👍 0
👎 0
← 返回 dev.to 首页