Hacker News | 📄 原文链接 | 2026-09-29 收录

更少的思考 token,同样的答案:一个推理模型的新优化方向 — Hacker News 中文摘要

来源:fireworks.ai — 554 分 · by interpolate

📋 概述

Fireworks Research 发布 Ember-1,切入点是一个被忽视的成本问题:像 Kimi K3 这样的推理模型会把超过 90% 的生成 token 花在内部推理上而不是答案本身,单次请求已经很贵,在多轮智能体负载下更糟——每一轮都要把之前所有推理重放给模型,上下文随轮数近似平方增长,早期轮次的长推理被反复重读、反复计费。团队为此跑了 50 多次训练实验和 200 多轮评测,并开发了新的训练算法来压缩推理长度而不损失准确率。训练数据覆盖数学、编程、指令遵循、对话、搜索、工具使用与软件工程,既包含独立问题也包含长交互,以强化对观测与结果的适应。评测上 Ember-1 在 Doximity 的 Bedside Bench(500 个临床案例、10 个专科)上处于帕累托前沿,客户侧 A/B 测试显示任务完成率与失败率均持平或改善而 token 成本显著下降,一家客户已上生产并计划完全替换基础模型;内部流量上做无感上线,自家开发者都没察觉,被视为最强信号。

🔑 核心要点

💡 金句

Reasoning models like Kimi K3 spend the majority of their generated tokens, sometimes more than 90%, on internal reasoning rather than the answer itself.
← 返回 Hacker News 首页