Hacker News|📄 原文链接|2026-07-26 收录

ARC-AGI 排行榜:衡量通用人工智能的基准测试

来源:arcprize.org — 2026-07-26 · 158 points · by rzk

📋 概述

ARC-AGI(抽象推理语料库)排行榜展示了各 AI 模型在人类级推理任务上的表现。该基准测试使用网格图案推理题,要求模型从少数示例中推断隐藏规则,被认为是最接近测量「通用智能」的标准,目前人类得分 85%,而最佳 AI 系统仍差距显著。

🔑 核心要点

💡 金句

当 AI 能看一眼三个例子就猜出第四个图案时,我们才真正接近了通用智能。现在,它还在努力。
← 返回 Hacker News 首页