dev.to | 📄 原文链接 | 2026-09-19 收录

Jev 对 Claude:小模型在结构化决策上能赢吗

来源:dev.to — 2026-09-18

📋 概述

作者不需要 Jev 在通用评测上打败 Claude 或 Kimi,他需要知道能不能把一件自己经常做、且误判代价很高的决策交给它。测试用了 2026 年 Arbitrum 线上 Buildathon 的 102 份归档提交,都是匿名编号,每个系统拿到同样的 JSON 证据包与同样的四步决策流程,每种配置跑三次共 306 次判定,对手是 Claude Sonnet。结果精度几乎持平:Jev 100% 对 Sonnet 99%,但中位延迟 378 毫秒对 3554 毫秒,一万次评估成本约 2.27 美元对 129.74 美元——约 57 倍。

🔑 核心要点

💡 金句

如果我要的输出只是三种已知状态之一,而一个面向决策的模型能以约五十分之一的运行成本给出同等精度,那这就从一个模型对比问题变成了系统设计问题。
← 返回 dev.to 首页