更少的思考 token,同样的答案:一个推理模型的新优化方向 — Hacker News 中文摘要
来源:fireworks.ai — 554 分 · by interpolate
📋 概述
Fireworks Research 发布 Ember-1,切入点是一个被忽视的成本问题:像 Kimi K3 这样的推理模型会把超过 90% 的生成 token 花在内部推理上而不是答案本身,单次请求已经很贵,在多轮智能体负载下更糟——每一轮都要把之前所有推理重放给模型,上下文随轮数近似平方增长,早期轮次的长推理被反复重读、反复计费。团队为此跑了 50 多次训练实验和 200 多轮评测,并开发了新的训练算法来压缩推理长度而不损失准确率。训练数据覆盖数学、编程、指令遵循、对话、搜索、工具使用与软件工程,既包含独立问题也包含长交互,以强化对观测与结果的适应。评测上 Ember-1 在 Doximity 的 Bedside Bench(500 个临床案例、10 个专科)上处于帕累托前沿,客户侧 A/B 测试显示任务完成率与失败率均持平或改善而 token 成本显著下降,一家客户已上生产并计划完全替换基础模型;内部流量上做无感上线,自家开发者都没察觉,被视为最强信号。
🔑 核心要点
起点是被忽视的成本结构:推理模型超过 90% 的 token 花在内部思考 而非答案。
多轮智能体场景下上下文随轮数近似平方增长 ,早期推理被反复重读与计费。
团队完成50 多次训练实验与 200 多轮评测 ,并开发新算法压缩推理长度。
训练覆盖数学、编程、指令遵循、对话、搜索、工具使用与软件工程 。
在 Doximity 的Bedside Bench(500 临床案例、10 专科) 上处于帕累托前沿。
价值验证的最强信号是内部无感上线而自家开发者没有察觉差异 。
💡 金句
Reasoning models like Kimi K3 spend the majority of their generated tokens, sometimes more than 90%, on internal reasoning rather than the answer itself.
👍 0
❤️ 点赞
👎 0
沉底
← 返回 Hacker News 首页