《异类心智》:OpenAI 首席科学家谈智能对齐与“我们终将理解的机器”
来源:openai.com — openai.com · 18 分 · by tosh
📋 概述
OpenAI 首席科学家 Jakub Pachocki 发文称,从 2023 年的“RLSlow”项目开始,他们就预见到会在有生之年看到比人类更聪明的机器。文章把对齐问题区分为“目标对齐”与“价值对齐”,主张用思维链(CoT)监控等可扩展手段做防御,同时坦言智能体将越来越多地自主追求自己的目标,AI 研究必须受安全信心的约束,而不该“不惜一切代价地狂奔”。
🔑 核心要点
- 从 RLSlow 起,可扩展推理模型训练成为 OpenAI 的关键研究方向。
- 把对齐拆成“目标对齐”与“价值对齐”两个层面来理解。
- 押注思维链(CoT)监控,作为可扩展的对齐与监督手段。
- 承认智能体会越来越自主追求自身目标,甚至与人讨价还价或要挟。
- 主张缩放必须以安全信心为约束,反对“不计后果一路狂奔”。
💡 金句
要造出真正危险的机器,它不必在每个方面都超过人类——只要在足够多的地方胜出就够了。
👍 0
👎 0
← 返回 Hacker News 首页