Lobsters | 原文链接 | 2026-09-20 收录

我一年前就做出了非自回归决策模型,前沿实验室把它称作「突破」

来源: dev.to — 2026-09-18

概述

作者 Nandakishor M 讲述一段被「抢先命名」的经历:他 2025 年 3 月就发表了关于强化学习决策轨迹的 arXiv 论文(2503.23303),放出模型权重、开放数据集、PyPI 包和 Reddit 讨论;2025 年 9 月又发第二篇论文给出基于 schema 的 RL 决策框架。2026 年 9 月,TypeSafe AI 发布 Jev,提出几乎相同的非自回归决策概念,却没有技术论文、没有开放权重、没有公开训练数据。他不打算抱怨,而是基于旧工作的教训重建了一个完全开放的横向决策模型 RL Agent:421M 参数、双向编码器,单次前向并行回答所有问题,GPU 上 33 到 38 毫秒,约为 Jev 公布的 150 毫秒延迟的四分之一。

核心要点

金句

当 LLM 输出「置信度 0.95」时,它只是在预测听起来自信的 token,背后没有任何数学标定。
← 返回 Lobsters 首页