开源权重模型 GLM-5.3 以约五分之一成本登顶评测榜
来源:reinvently.co.uk — 排名 #4 · 62 分
📋 概述
独立基准 Ed-o-meter 用同一套 28 个真实任务、同一套提示词对 17 个主流模型做确定性评分,结果显示 GLM-5.3 五个维度全部 100% 通过、综合登顶,跑完整个测试仅需 0.28 美元,约为 gpt-5.5 成本的五分之一。
🔑 核心要点
- GLM-5.3 是首个五个评测维度全部 100% 通过的模型。
- 完整一圈测试成本 0.28 美元,约 gpt-5.5 的五分之一。
- gpt-5.5 是更快的替代选择,首字延迟 13.2 秒,但真实世界维度仅 89%。
- gpt-5.6 系列三个模型在越狱测试中出现安全告警,需谨慎防护。
💡 金句
同一个驾驶员,同一条赛道,模型才是唯一的明星。
👍 0
👎 0
← 返回 Hacker News 首页