编码代理的「外壳税」:外壳影响成本多于正确性
来源: harnesstax.github.io — 2026-09-16
概述
伯克利与 Arena 的研究者评测了 21 组「模型—外壳」组合,涵盖七个模型与 Claude Code、Codex CLI、Pi 三个外壳,在 SWE-bench Lite 与 Terminal-Bench 2.0 上各取 30 个任务、每组跑三次。三个发现是:外壳对成功率影响很小却显著影响成本,同一模型在最多 5 倍成本下能达到相近成功率;只用 read、write、edit、bash 四个工具的极简外壳 Pi 同样站上帕累托前沿;模型用别人的外壳可能比自己家的更好,Claude 模型未必需要 Claude Code。
核心要点
- 成功率的外壳效应很小:SWE-bench Lite 上在 ±2% 以内,Terminal-Bench 2.0 上约在 ±5% 以内。
- 成本差异明显:Claude Code 约为 Pi 的 2.0 倍、Codex 的 1.6 倍(SWE-bench Lite)。
- Claude Fable 5 在三种外壳里解决率分别是 97.8%、96.7%、96.7%,而 Claude Code 成本约为 Pi 的两倍。
- 极简外壳 Pi 只提供 read、write、edit、bash 四个工具,却能在成本与成功率上都进入帕累托前沿。
- 作者把这种隐形成本称为 harness tax,呼吁模型评测应跨常用外壳比较同一模型的成本与成功率。
金句
为几乎相同的质量多付钱,就像在交一笔「外壳税」。
👍 0
👎 0
返回 Lobsters 首页