ARC-AGI 排行榜:衡量通用人工智能的基准测试
来源:arcprize.org — 2026-07-26 · 158 points · by rzk
📋 概述
ARC-AGI(抽象推理语料库)排行榜展示了各 AI 模型在人类级推理任务上的表现。该基准测试使用网格图案推理题,要求模型从少数示例中推断隐藏规则,被认为是最接近测量「通用智能」的标准,目前人类得分 85%,而最佳 AI 系统仍差距显著。
🔑 核心要点
- ARC-AGI 测试基于少量示例的抽象规则推理,不依赖预训练知识
- 人类平均得分85%,当前最佳 AI 系统得分约55%
- 测试设计刻意排除了语言和文化偏见,纯视觉逻辑推理
- 排行榜已成为AGI 进展的主要晴雨表,奖金池超过百万美元
💡 金句
当 AI 能看一眼三个例子就猜出第四个图案时,我们才真正接近了通用智能。现在,它还在努力。
← 返回 Hacker News 首页