在 Navier-Stokes 之后,我为什么依然看空大模型
来源: dank.systems — 2026-09-15
概述
作者列出一系列论点:前沿实验室的估值建立在「很快就能完全替代多数知识工作者」的叙事上,但当前前沿模型连最简单的任务都需要大量监督与护栏;模型只在自己受训任务的邻域内泛化良好,轻微扰动就会失败或出现奖励作弊。而解决奖励作弊只能依靠领域专家写出严格规格,这本身是一门昂贵且稀缺的技能;人类评审也无法随模型产出规模扩展——xz 后门与被撤回的 UMN 提交就是例子。
核心要点
- 纯数学定理是智能体工作的最佳情形:定理陈述本身就是严格规格,且经过数十年同行审计,绝大多数知识工作并非如此。
- 硬件工程可作参照:一个 CPU 项目的规格与验证工程师常是设计工程师的三倍,5:1 也不罕见。
- 即使 Lean 也有可靠性缺陷,历史上出现过让错误证明穿过证明内核的先例。
- 人类评审无法线性扩展,而且专家评审同样容易被奖励作弊绕过。
- 如果人评审仍是生产循环的关键环节,产出节奏就必然被评审瓶颈限制,他预计冲击范围会远超前沿实验室本身。
金句
数据中心的「天才」可以自我驱动、只受算力限制;而「笨蛋集群」会被人类协调者严重限制。
👍 0
👎 0
返回 Lobsters 首页