大模型文本生成解码策略:Greedy / Beam / Top-K / Top-P

解码策略决定「下一个词怎么从概率分布里挑出来」。面试常考:Top-k 与 Top-p 的本质区别,以及温度 T 与采样的关系。

策略名称核心原理核心优势核心缺陷适用场景关键说明 / 易错点
贪婪搜索(Greedy Search)每步直接选当前概率最高的单个 token,无回溯最快、最稳、无随机波动局部最优;易循环重复;无多样性简单问答、摘要、事实性任务、代码补全所有策略的对比基准
束搜索(Beam Search)每步保留 top-k 条候选路径,扩展剪枝后选最优完整路径比贪婪更连贯;结果确定仍非全局最优;缺创意;束宽大则成本高传统机器翻译、长摘要对话场景已少用
随机采样(Random Sampling)按全词表概率分布随机采样;常配合温度 T多样性强、适合创意易采到离谱 token;可控性差创意写作、诗歌、脑洞内容T>1 更平;T<1 更尖、趋近贪婪
Top-k 采样先取概率最高的前 k 个,再归一化后采样抑制离谱词;通顺度明显提升k 固定,难适配不同步的概率分布对话、故事、中等创意k 常 5~100;k=1 等价贪婪
Top-p(Nucleus)采样按概率从高到低取累积概率达 p 的最小词集,再采样候选集动态适配;平衡多样性与通顺度;工业默认p 过小退化为贪婪;过大仍离谱通用对话、文案、多轮交互与 Top-k 逻辑不同;p 常 0.7~0.9;p=1 等价全量随机

对比结论

  1. Top-k:固定数量选词;Top-p:固定累积概率选词,候选数量随分布变化。
  2. Top-p 效果普遍优于 Top-k,主流大模型(GPT、Llama)默认 Top-p。
  3. Top-k / Top-p 只是筛选候选词温度 T 在筛选前重塑整个概率分布
    • T 越小 → 高分词概率被放大,生成更确定
    • T 越大 → 概率趋于平均,随机性更强