对比式语言模型 CLM:用 InfoNCE 把状态与动作直接对齐
来源:contrastive-lm.notion.site — 92 分 · by erichocean
📋 概述
CLM(Contrastive Language Model)提出了一套不同于自回归的架构与数据配方:先在大规模数据上用对比目标 InfoNCE 训练一个状态编码器和一个动作编码器,让每个状态被拉向真实执行的那个动作、同时被推离所有其它动作,训练完成后这两个编码器本身就直接充当零样本动作分类器,不再需要逐 token 生成。项目配套给出了数据配方与缩放规律。据该项目公开仓库与作者线程,CLM-8B 以 Apache 2.0 开放,作者自报在电脑操作、游戏与工具调用上与 TypeSafe 的 Jev 表现相当、延迟最多低 9 倍,轻量微调后作为验证器可把 DeepSWE 提升到 81.6%、Terminal-Bench 2.1 提升到 87.6%——这些数字为自报结果,需要独立复现。
🔑 核心要点
- 架构核心是双编码器:状态编码器 + 动作编码器,而不是单个自回归模型。
- 训练目标是对比式 InfoNCE:把状态拉近真实动作,推远其它所有动作。
- 推理方式因此改变:编码器直接充当零样本动作分类器,不必逐 token 解码。
- 项目同时给出数据配方与缩放规律,是架构、数据、规模三件套一起放出的。
- 自报结果显示 CLM-8B 以 Apache 2.0 开放,在电脑操作、游戏与工具调用上对标 Jev 且延迟最多低 9 倍。
- 轻量微调后可当验证器:作者称 DeepSWE 达 81.6%、Terminal-Bench 2.1 达 87.6%,均为自报数值。
💡 金句
CLM 先用对比目标(InfoNCE)在大规模数据集上训练状态编码器与动作编码器,使每个状态被拉向实际执行的真实动作,同时被推离所有其它动作。
👍 0
👎 0
← 返回 Hacker News 首页