你能战胜大模型吗?构建人类 vs 人类最后的考试
来源:dev.to/entire — 2026-07-21 发布
📋 概述
前沿模型正在碾压一个又一个基准测试——于是作者构建了一个测验来回答一个简单但令人谦卑的问题:人类还能赢过它们吗?Humans vs. HLE 是一个基于 Web 的测验,让你在「人类最后的考试」(Humanity's Last Exam)上与前沿 AI 模型对战。HLE 包含专家级学术问题,错 4 题即淘汰。你的分数将与前沿模型精度对比,同时进入持久化排行榜。应用运行在 Cloudflare Workers 上,题目在构建时烘焙到 JSON 中,使用 Durable Objects 管理排行榜,服务端评分防止作弊。
🔑 核心要点
- HLE 基准专为挑战前沿模型设计,题目来自专家级学术材料,远非普通问答水平。
- 采用 服务端评分杜绝作弊,搭配 Durable Objects 实现持久化排行榜。
- 全套 Cloudflare Workers 架构,题目烘焙到构建产物中而非运行时加载。
- 使用 Claude Code Opus 4.8 开发,编辑 27 个文件,912 行新增代码。
- 错 4 题即淘汰的机制增加了回答压力,真实模拟学术评估的场景。
💡 金句
Frontier models are crushing benchmark after benchmark...so I built a quiz to ask this simple yet humbling question: can a human still beat them?
👍 0👎 0
← 返回 Dev.to 首页