dev.to | 📄 原文链接 | 2026-09-12 收录

讲清 LLM 采样:温度、Top-k、Top-p、Min-p 与重复惩罚

来源:dev.to — 2026-09-10

📋 概述

语言模型并不真的「写」下一个 token,它先给出词表上的一个概率分布,之后发生的一切都是解码。同一个模型、同一个提示,采样方式不同,生成的文本可以天差地别——2019 年对 GPT-2 的研究就发现解码策略本身能显著改变文本性格:贪心与束搜索倾向平淡重复,不加限制的采样会漂到低概率的胡言,而经过截断的采样更接近人类写作。文章由此把温度、top_k、top_p、min_p 与重复惩罚还原成同一个问题的不同答案:在这个概率分布上,我们愿意信任哪一部分;随后推进到公式、实现细节与线上后果。

🔑 核心要点

💡 金句

Given the model's probability distribution, which parts of that distribution are we willing to trust?
← 返回 dev.to 首页