Jev 对 Claude:小模型在结构化决策上能赢吗
来源:dev.to — 2026-09-18
📋 概述
作者不需要 Jev 在通用评测上打败 Claude 或 Kimi,他需要知道能不能把一件自己经常做、且误判代价很高的决策交给它。测试用了 2026 年 Arbitrum 线上 Buildathon 的 102 份归档提交,都是匿名编号,每个系统拿到同样的 JSON 证据包与同样的四步决策流程,每种配置跑三次共 306 次判定,对手是 Claude Sonnet。结果精度几乎持平:Jev 100% 对 Sonnet 99%,但中位延迟 378 毫秒对 3554 毫秒,一万次评估成本约 2.27 美元对 129.74 美元——约 57 倍。
🔑 核心要点
- 测试问题是窄的、被刻意限定的:satisfied、not_satisfied 还是 insufficient_evidence,这不是一个写作任务。
- 两边条件完全一致:同样的证据包与四步流程,102 份提交 × 3 次运行 = 每种配置 306 次判定。
- Jev 达到 100.0% 准确率,零误判通过、零误报,三次运行完全一致;Claude Sonnet 在高推理档位为 99.0%。
- 精度在同一量级,经济性却急剧分化:中位延迟 378 毫秒对 3554 毫秒,约 9.4 倍差距。
- 按实测用量与定价,一万次评估约 2.27 美元对 129.74 美元,差约 57 倍。
- 作者承认这是刻意为窄任务设计的对决,不适合用来做泛化的模型比较,但恰好是检验「专为有界决策构建」这一主张的最佳位置。
💡 金句
如果我要的输出只是三种已知状态之一,而一个面向决策的模型能以约五十分之一的运行成本给出同等精度,那这就从一个模型对比问题变成了系统设计问题。
👍 0
👎 0
← 返回 dev.to 首页