让决策模型先推理再下判断:Jeeves 的思路 — Hacker News 中文摘要
来源:github.com — 171 分 · by nicowaltz
📋 概述
Jev 这类模型能给出校准良好的决策概率,但准确率偏低,于是很多流水线不得不再挂一个推理模型兜底。PostHog 开源的 Jeeves 把这一步内化:以 Qwen3.5-9B 为基座,加 LoRA 与指针头,用 CISPO 训练模型先推理再决定,并配一个 block-4 扩散草稿器加速。同一个请求里支持 yes/no、多选与打分三种题型,在未训练过的测试数据上准确率 0.889,高于 Kev-9B 的 0.822 与 Jev 的 0.857。
🔑 核心要点
- 要解决的问题是 Jev 类模型概率校准好但准确率低,只能靠推理模型兜底。
- Jeeves 的做法是让模型先推理再输出决策。
- 基座是 Qwen3.5-9B 加 LoRA 与指针头,训练使用 CISPO。
- 一个请求同时支持 yes/no、多选与打分三种题型。
- 在 JevBench 公开档位上达到 0.935,高于 Jev 的 0.866。
- 单张 H100 上不推理约 0.3 秒,带推理中位数约 3.3 秒。
💡 金句
Jev-like models give calibrated decision probabilities, but at low accuracy.
👍 0
👎 0
← 返回 Hacker News 首页