评分标准里的一句话让我掉进了三层调试兔子洞
来源:dev.to — Jul 20
📋 概述
Arek H 在黑客松截止前 48 小时重读评分标准,发现一句之前跳过的话:「相比单代理基线的可衡量效率增益」。他的多代理系统 RedCouncil 有 68 个通过的测试,但从未验证是否真的优于单模型调用。他快速构建了评估管道,却接连发现三层 bug:空指标、打分的提示词无意中泄漏了答案、以及数据存储未正确写入。
🔑 核心要点
- 截止前 48 小时发现评分标准要求「相比单代理基线的可衡量效率增益」
- RedCouncil:五个专业 AI 代理(增长/风险/法律/技术债/客户)对抗辩论业务决策
- Bug 1:`domains_missed_by_baseline` 指标始终为空——不是系统完美,是统计代码未正确处理空集合
- Bug 2:打分提示词无意中泄漏了预期答案——评估污染,模型知道它应该看到什么
- 教训:先读原始数据再看摘要——只看汇总数字会掩盖系统性评估缺陷
💡 金句
68 个测试全通过。认证、存储、部署,全部完成。但我从未测量过它是否真的比单次模型调用更有效。评分标准里的一句话,在我截止前 48 小时读到。
👍 0
👎 0
← 返回 Dev.to 首页