这篇论文把编码智能体的脚手架拆开做分级实验:固定执行循环,只变动规划、动作空间与上下文管理三块,在 SWE-Bench Verified 与 Terminal-Bench 2.1 上用四个模型跑了 176 组对照设置,覆盖五种上下文管理策略与四档上下文窗口预算。结论是上下文预算越紧,上下文管理的收益越大,而收益主要来自避免上下文溢出的失败,并非提升推理质量;在 LLM 摘要之前先用规则做裁剪的综合效率最高,把被裁掉的内容做成可恢复反而增加了模型几乎不用的机制且没有准确率收益;规划对弱模型是准确率脚手架,对强模型只剩省钱作用;预定义工具能帮 bash 能力弱的模型,而熟悉 bash 的模型仅靠 bash 接口也能打好。