拿 Jev 试玩 2048:非自回归决策模型的真实水平
来源: gist.github.com — 2026-09-19
概述
作者用 2048 游戏给 TypeSafe 的决策模型 jev-1.13.0 做了一轮朴素试驾,把棋盘状态和上下左右四个选项交给模型,并用四种问法做了对照实验。结果不太好看:只给棋盘时它的中位得分只有 706,和随机走子(1102)在同一水平;补上规则和每种走法的说明后升到 1656;把每个走法导致的棋盘与得分都算好再交给它,中位得分 2494、最大 5532、最好方块到 512,大致追平一条固定规则。
核心要点
- 只给棋盘时,jev 的中位得分 706 分,反而低于随机走子的 1102 分,而且 24% 的情况下首选是「什么都改变不了」的一步。
- 在 48 局对照中,固定规则「能下就下、否则左、再右、再上」的中位得分是 1964,最大 7196,最好方块 512。
- 补上规则与每个走法的文字说明后,jev 的中位得分升到 1656(最好方块 256),说明「把问题翻译清楚」比模型本身更重要。
- 把每个走法导致的棋盘、得分都预先算好再交给 jev 时,它的中位得分跳到 2494、最大 5532,此时它已经等同于一条不错的固定规则。
- 作者坦言自己没花很多时间调试,「很可能漏掉了什么」,这次试驾更像一次粗略的可行性摸底而非严格评测。
金句
只把棋盘交给它时,它的表现和随机走子差不多。
👍 0
👎 0
← 返回 Lobsters 首页