4768 次 LLM 运行、零丢失批次:为超时、挂起与成本加固现场测试器
来源:dev.to — 2026-09-12
📋 概述
CauterRule 是一个从重复 agent 失败中学习长期规则的开源工具,v0.3.0 是它第一个跑完的现场测试:40 个语料库乘 2 个模型等于 4768 次运行。作者的原始 runner 基于三个在 50 次规模下成立、在 4768 次规模下失效的假设:模型总会响应、超时可以重试、失败轨迹应重试到成功。修法是五个小护栏,核心原则是「一个坏请求只损失一条轨迹,而不是整批」——关键在于逐个 future 的 result(timeout),而不是 with 上下文管理器,后者会等所有线程结束。
🔑 核心要点
- 规模是 40 个语料库乘 2 个模型,共 4768 次运行,每个模型约 2384 条轨迹。
- 三个在 50 次规模成立、在 4768 次规模失效的假设,本质上都是harness 问题。
- 五个护栏:逐轨迹超时、超时不可重试、token 上限、隔离名单、关闭时取消未完成任务。
- with ThreadPoolExecutor 退出时会 shutdown(wait=True),一个卡住的线程就能挂死整批。
- 每个模型被安全门拦下 580 条轨迹,对抗性提升为 0。
💡 金句
原则只有一条:一个坏掉的请求代价是一条轨迹,而不是整批 sweep。
👍 0
👎 0
← 返回 dev.to 首页