Cognition 发布 SWE-2:把强化学习做到多万亿参数,逼近前沿却便宜 64%
来源:cognition.com — cognition.com · 82 分 · by seelos
📋 概述
Cognition 推出迄今最强的编码模型 SWE-2,主打能力与成本的帕累托前沿:在 FrontierCode 1.1 Main 上取得 50.0%,仅落后 Fable 5.1 一个百分点,却便宜 64%。SWE-2 从 2.8 万亿参数的 Kimi K3 后训练而来,首次把强化学习扩展到多万亿参数规模;训练侧用长度加权的奖励基线来降低梯度估计方差,并让训练尽量直接反映真实用户成本。团队同时延续模型可信度评测:SWE-2 在宣传与审查类测试中整体通过率 98.0%,其中英文 99.8%、简体中文 95.2%、繁体中文 99.1%。模型即日起在 Devin Desktop 与 CLI 上线,并逐步在 Devin Web 与 Fusion 铺开。
🔑 核心要点
- FrontierCode 1.1 Main 得 50.0%,与 Fable 5.1 仅差 1 分却便宜 64%。
- 首次把强化学习扩展到多万亿参数规模。
- 基座是 2.8T 参数的 Kimi K3,此前已经过大量智能体编码 RL。
- 训练侧引入长度加权奖励基线降低梯度估计方差。
- 可信度测试整体通过率 98.0%,简体中文 95.2%。
💡 金句
我们第一次把强化学习做到了多万亿参数的规模——而它每跑一次,还比对手便宜六成。
👍 0
👎 0
← 返回 Hacker News 首页