Show HN:FrontierHarness Eval 横向评测九种 Agent 框架
来源:frontierharness.org — 排名 #16 · 20 分
📋 概述
FrontierHarness Eval 在统一的 Runta 运行时上、以黄金检查点新鲜恢复的方式,横向对比九种 agent 框架(Codex、DeepSeek、Claude Code、Kimi Code、Hermes 等)在软件工程与终端任务上的通过率、每次任务成本、缓存命中率与耗时。它强调缓存命中率不是成本、被排除的失败会让数字失真等易被忽略的细节。
🔑 核心要点
- 在同一硬件与黄金检查点下对比九种框架
- 衡量通过率、单任务成本、缓存命中率与耗时
- 指出排除失败样本会让每次任务成本失真
- 强调缓存命中率并不等于成本
- Claude Code 通过最多任务但单任务成本也最高
💡 金句
缓存命中率不是成本;一段缓存命中的三百轮失败可能烧掉更多。
👍 0
👎 0
← 返回 Hacker News 首页