Lobsters | 原文链接 | 2026-09-15 收录

机器学习研究智能体为什么不会过拟合:压缩与泛化

来源: amazon.science — 2026-09-10

概述

整个研究社区多年来在同一批基准上反复爬山,按教科书说法早该过拟合,然而换用全新测试集时改进依然能迁移。这篇 Amazon Science 的文章用可以重置主体、可以裁剪输入的智能体做了可控实验。实验设置三角色:探索者在新问题上反复对着验证集迭代,压缩者把整段实验记录提炼成极短提示,复现者只能凭这段提示与训练数据从零实现,且看不到验证集、代码与记录。结论是成功策略高度可压缩:在覆盖表格分类、图像分类、语言建模、扩散建模与奖励建模的八个数据集上,32 token 就足以让复现者匹配探索者;某个语言建模策略甚至压到 16 token 仍无损。把反馈压到一比特(只告诉你是否刷新最好成绩)也能找到同样好的策略。反过来,被诱导真正过拟合的智能体(102 次实验里有 38 次验证集表现超出真实测试集 10% 以上)其收益在压缩后消失——压缩因此既是解释,也是抓过拟合的检测器。

核心要点

金句

能用很少 token 装下的东西,不会过拟合。
返回 Lobsters 首页