我一年前就做出了非自回归决策模型,前沿实验室把它称作「突破」
来源: dev.to — 2026-09-18
概述
作者 Nandakishor M 讲述一段被「抢先命名」的经历:他 2025 年 3 月就发表了关于强化学习决策轨迹的 arXiv 论文(2503.23303),放出模型权重、开放数据集、PyPI 包和 Reddit 讨论;2025 年 9 月又发第二篇论文给出基于 schema 的 RL 决策框架。2026 年 9 月,TypeSafe AI 发布 Jev,提出几乎相同的非自回归决策概念,却没有技术论文、没有开放权重、没有公开训练数据。他不打算抱怨,而是基于旧工作的教训重建了一个完全开放的横向决策模型 RL Agent:421M 参数、双向编码器,单次前向并行回答所有问题,GPU 上 33 到 38 毫秒,约为 Jev 公布的 150 毫秒延迟的四分之一。
核心要点
- 旧方案(2025 年 3 月)用冻结序列嵌入加独立的 PPO 价值网络,只能做逐轮销售转化预测,不是端到端,也无法在运行时接受动态新问题。
- 新模型提供三种决策原语:choice(从选项里挑一个)、score(在有序量表上打分)、noul(直接问是/否的布尔概率),一次前向传播并行求值。
- 架构上是 395M 的 ModernBERT-large 双向编码器,总计 421M 参数,输出空间严格限定为概率和数字,因此不生成文本、无法幻觉,也不可能产出坏 JSON。
- 作者直指生成式大模型的软肋:「当 LLM 输出 confidence: 0.95 时,它只是在预测听起来自信的 token,背后没有任何数学标定」。
- 商业对比上,Jev 按每百万输入 token 收费 0.042 美元、响应约 150 毫秒,而作者的开源模型 在 GPU 上跑 33 到 38 毫秒,且百分之百开源。
金句
当 LLM 输出「置信度 0.95」时,它只是在预测听起来自信的 token,背后没有任何数学标定。
👍 0
👎 0
← 返回 Lobsters 首页