Agent 说它成功了,我去问了内核
来源:dev.to — 2026-09-15
📋 概述
作者的回应正从「它说能跑」变成「让我看看抓包」。受「92% 是相对什么而言」这个问题的启发,他用 AI 协助写了一个小型原生备份客户端,给它预设八种行为,然后从它自己的日志之外去观察:eBPF、CPU 采样、数据包和被真正节省下来的字节。在评估 Agent 的代码之前,他先造了一个行为已知的客户端来校准测量工具本身。这大概是种人格问题,但目前为止,它是一次实验。
🔑 核心要点
- 判断标准从「它说能跑」升级为「让我看抓包」。
- 用 eBPF、CPU 采样、网络包与落盘字节构成程序自身日志之外的证据。
- 先造一个行为已知的备份客户端来校准测量工具,再评估 Agent 的代码。
- 起点是「92% 是相对什么而言」——基准饱和后评估会变得信息量更低。
- 有些变体能产出正确的日志,却在外部观测下暴露真实行为的差异。
💡 金句
对「它成功了」的标准回答,正在变成「让我看看抓包」。
👍 0
👎 0
← 返回 dev.to 首页