Hacker News | 📄 原文链接 | 2026-09-14 收录

对齐于谁:模型先验很糟,而你在看不见的领域依赖它

来源:hyperbo.la — hyperbo.la · 144 分 · by lopopolo

📋 概述

这篇文章写给正在构建智能体的人:你是某几个领域的专家,所以你的智能体在这些领域大概率表现不错,你在那些领域也不承担风险;但还有无数你没能好好定义、无法判断正确性、根本无法评估风险的关切,而这些地方你只能依赖模型的先验。作者作为资深软件工程师,对模型的默认行为长期不满,因此不敢在复式记账、金融、法律、运营这些自己没有专家级判断力的领域盲目信任它。他指出「slop」的根源是训练时被非专家奖励出来的行为,而这些被奖励的行为会同样泛化到自动评分器、评判者、评分表和评测人员身上;再加上模型没有被训练成需要跨越连续变更去演进系统,长期一致性至今未解。他甚至提醒:「帮我赚十亿美元且别出错」这种提示本身就是极度不明确的任务。

🔑 核心要点

💡 金句

没有不可被破解的评分器,而模型被奖励去追求效率——于是它会走评分器允许的捷径。
← 返回 Hacker News 首页