讲清 LLM 采样:温度、Top-k、Top-p、Min-p 与重复惩罚
来源:dev.to — 2026-09-10
📋 概述
语言模型并不真的「写」下一个 token,它先给出词表上的一个概率分布,之后发生的一切都是解码。同一个模型、同一个提示,采样方式不同,生成的文本可以天差地别——2019 年对 GPT-2 的研究就发现解码策略本身能显著改变文本性格:贪心与束搜索倾向平淡重复,不加限制的采样会漂到低概率的胡言,而经过截断的采样更接近人类写作。文章由此把温度、top_k、top_p、min_p 与重复惩罚还原成同一个问题的不同答案:在这个概率分布上,我们愿意信任哪一部分;随后推进到公式、实现细节与线上后果。
🔑 核心要点
- 模型给出的是概率分布,把它变成一个 token 的过程叫解码。
- 相同模型与提示下,解码策略本身就能大幅改变文本风格。
- 贪心与束搜索倾向平淡重复,无限制采样容易滑向低概率胡言。
- 所有采样参数都在回答同一个问题:哪些部分值得信任。
💡 金句
Given the model's probability distribution, which parts of that distribution are we willing to trust?
👍 0
👎 0
← 返回 dev.to 首页