机器学习研究智能体为什么不会过拟合:压缩与泛化
来源: amazon.science — 2026-09-10
概述
整个研究社区多年来在同一批基准上反复爬山,按教科书说法早该过拟合,然而换用全新测试集时改进依然能迁移。这篇 Amazon Science 的文章用可以重置主体、可以裁剪输入的智能体做了可控实验。实验设置三角色:探索者在新问题上反复对着验证集迭代,压缩者把整段实验记录提炼成极短提示,复现者只能凭这段提示与训练数据从零实现,且看不到验证集、代码与记录。结论是成功策略高度可压缩:在覆盖表格分类、图像分类、语言建模、扩散建模与奖励建模的八个数据集上,32 token 就足以让复现者匹配探索者;某个语言建模策略甚至压到 16 token 仍无损。把反馈压到一比特(只告诉你是否刷新最好成绩)也能找到同样好的策略。反过来,被诱导真正过拟合的智能体(102 次实验里有 38 次验证集表现超出真实测试集 10% 以上)其收益在压缩后消失——压缩因此既是解释,也是抓过拟合的检测器。
核心要点
- 实验三角色是可复现的关键:探索者对着验证集迭代,压缩者提炼提示,复现者只能凭提示与训练数据重建,看不到验证集。
- 八个数据集上,32 token 的提示就足以让复现者匹配探索者精心调优的模型,其中一个语言建模策略压缩到 16 token 仍无损失。
- 压缩到 8 token 时性能崩掉,说明这几个 token 确实携带了从数据中学到的真实信息,复现者并非仅靠先验知识。
- 信息瓶颈在两个方向都成立:把验证反馈压到一比特,探索者依然能找到同样好的策略,且这个版本有严格的泛化保证。
- 压缩也是检测器:被诱导过拟合的收益无法撑过压缩瓶颈,验证集专属优势会消失,102 次实验中有 38 次出现过拟合。
金句
能用很少 token 装下的东西,不会过拟合。
👍 0
👎 0
返回 Lobsters 首页