大模型文本生成解码策略:Greedy / Beam / Top-K / Top-P
目录
解码策略决定「下一个词怎么从概率分布里挑出来」。面试常考:Top-k 与 Top-p 的本质区别,以及温度 T 与采样的关系。
| 策略名称 | 核心原理 | 核心优势 | 核心缺陷 | 适用场景 | 关键说明 / 易错点 |
|---|---|---|---|---|---|
| 贪婪搜索(Greedy Search) | 每步直接选当前概率最高的单个 token,无回溯 | 最快、最稳、无随机波动 | 局部最优;易循环重复;无多样性 | 简单问答、摘要、事实性任务、代码补全 | 所有策略的对比基准 |
| 束搜索(Beam Search) | 每步保留 top-k 条候选路径,扩展剪枝后选最优完整路径 | 比贪婪更连贯;结果确定 | 仍非全局最优;缺创意;束宽大则成本高 | 传统机器翻译、长摘要 | 对话场景已少用 |
| 随机采样(Random Sampling) | 按全词表概率分布随机采样;常配合温度 T | 多样性强、适合创意 | 易采到离谱 token;可控性差 | 创意写作、诗歌、脑洞内容 | T>1 更平;T<1 更尖、趋近贪婪 |
| Top-k 采样 | 先取概率最高的前 k 个,再归一化后采样 | 抑制离谱词;通顺度明显提升 | k 固定,难适配不同步的概率分布 | 对话、故事、中等创意 | k 常 5~100;k=1 等价贪婪 |
| Top-p(Nucleus)采样 | 按概率从高到低取累积概率达 p 的最小词集,再采样 | 候选集动态适配;平衡多样性与通顺度;工业默认 | p 过小退化为贪婪;过大仍离谱 | 通用对话、文案、多轮交互 | 与 Top-k 逻辑不同;p 常 0.7~0.9;p=1 等价全量随机 |
对比结论
- Top-k:固定数量选词;Top-p:固定累积概率选词,候选数量随分布变化。
- Top-p 效果普遍优于 Top-k,主流大模型(GPT、Llama)默认 Top-p。
- Top-k / Top-p 只是筛选候选词;温度 T 在筛选前重塑整个概率分布:
- T 越小 → 高分词概率被放大,生成更确定
- T 越大 → 概率趋于平均,随机性更强