
解码策略全景在进入性能分析之前,必须先建立一张清晰的策略地图。解码策略决定了生成过程的每一步如何从概率分布中选择下一个 token——这个看似微小的选择,既塑造了文本的形态,也从根本上划定了计算资源的消耗模式。从策略的数学动机出发,才能理解后续并行性和显存分析的真正根源。策略分类:确定性 vs. 随机性所有解码策略可以归为两大类:确定性策略和随机性策略。确定性策略在给定相同的模型权重和输入序列时,每次生成完全相同的结果。Greedy decoding(贪心解码)和Beam Search(束搜索)属于此类。它们的核心逻辑是"选最优"——每一步都基于当前概率分布做出最大化得分的选择,不同之处在于搜索的广度。随机性策略则在概率分布中进行采样,引入随机性以换取输出的多样性。Temperature sampling、Top-k和Top-p均属此类。它们的核心逻辑是"按概率抽取"——在每一步从(经过截断或重加权的)概率分布中随机采样一个 token。给定相同输入,两次生成的结果几乎必然不同。这两类策略在性能上的第一个关键差异即刻显现:确定性策略的推理路径