
文章目录1. 先唠唠为啥传统蒸馏不够用了1.1 以前的玩法本质就是抄答案1.2 现在卷的方向早就变了2. 捋一捋大模型对齐的进化之路2.1 从认字到会说话2.2 从会说话到说人话2.3 最后到学霸直接带飞3. 说人话OPD到底是个啥东西3.1 核心转变不学答案学排序3.2 为啥叫“在线”因为全程实时互动4. 一句话分清KD和OPD的核心区别4.1 底层逻辑完全不一样4.2 举个最接地气的例子5. 说点干的底层逻辑其实很简单5.1 核心就是成对比大小5.2 为啥必须加约束不然模型会耍小聪明6. 工业界为啥突然都拥抱OPD了6.1 第一RLHF实在是太贵了6.2 第二高质量标注越来越难找6.3 第三学霸本身就能当裁判6.4 第四小模型越出越多批量复制更香7. 真实工业玩法用顶级模型带小模型7.1 为啥不直接用顶级模型用不起啊7.2 一条能一直传下去的偏好链8. 别搞混RLHF、DPO、OPD到底啥关系9. 也不是万能的优势和坑都得说9.1 好处是真的香9.2 坑也真不少10. 最后收个尾P.S. 无意间发现了一个巨牛的人工智能教程非常通俗易懂对AI感兴趣的朋友强烈推荐去看看传送门https://blog.csdn.net/HHX_01今天跟大家聊个大模型圈最近越来越火的技术方向——OPD。说白了就是大模型蒸馏的目标已经从抄知识变成了抄判断力。1. 先唠唠为啥传统蒸馏不够用了1.1 以前的玩法本质就是抄答案传统知识蒸馏大家都熟大模型当老师小模型当学生。老师输出一套token概率分布学生照着拟合就行。就像考试背标准答案连每个选项的迷惑性比例都背得明明白白。比如问法国首都是啥老师输出巴黎占96%伦敦2%东京2%。学生连这个概率比例都一起学知识点掌握得死死的。1.2 现在卷的方向早就变了但发展到今天大模型之间的知识储备其实拉不开多大差距。你能覆盖的知识点我训练数据喂够了也都能有。真正拉开用户体验差距的是回答合不合心意、安不安全、会不会说话。就像同样回答“怎么学Python”给新手甩一堆工程化术语知识全对但人家直接劝退。传统KD根本分不出这种好坏它只知道这俩答案的token都合理。这就很尴尬了知识学到位了用户就是不爱用。2. 捋一捋大模型对齐的进化之路OPD不是凭空蹦出来的新概念它是对齐技术一路演进到现在的产物。我给大家掰着指头数整个过程一共好几步。2.1 从认字到会说话最开始是预训练阶段模型在海量文本里学语言规律。这阶段就像小孩刚背完字典字都认识凑一起就不会正常聊天。然后是SFT监督微调用标注好的问答对教它按指令输出。到这一步模型终于能正常对话了但回答质量全靠标注数据撑着。2.2 从会说话到说人话再往后就是大家熟悉的RLHF先训个奖励模型当评委再用强化学习调策略。相当于雇一堆人给回答排序手把手教模型“人类更喜欢啥”。效果是真好就是又贵又麻烦流程长、不稳定调参能调到头秃。后来出了DPO直接跳过显式的奖励模型用偏好数据对直接训练。相当于把评委的意见直接做成练习题一步到位流程简单了一大截。2.3 最后到学霸直接带飞再往后演进就是今天的主角OPD了。既然已经有模型把对齐能力练到满级了那还每个模型都重新走一遍流程干啥直接让这个满级学霸当老师把判断力教给小模型不就完了。一路看下来趋势特别明显对人工标注的依赖越来越低模型自身的判断力用得越来越多。3. 说人话OPD到底是个啥东西3.1 核心转变不学答案学排序传统KD里老师给的是标准答案。OPD里老师不给具体答案只给排名。学生先生成好几个候选回答老师告诉它哪个最好、哪个最差。学生不用死记硬背某一个固定答案而是学会判断“什么样的回答更好”。这就像学画画以前是照着原画抄细节现在是大师给你几张习作排好坏你自己悟审美。3.2 为啥叫“在线”因为全程实时互动很多人好奇为啥要叫“在线”偏好蒸馏。传统蒸馏是离线的老师提前把所有题的答案都生成好学生对着固定数据集反复练。就像提前印好的习题册答案都是写死的。OPD不一样学生每更新一次参数生成的回答风格就会变。老师每次都对着新生成的回答重新打分排序全程动态迭代。相当于学霸一对一陪练你每练一轮他就给你批一轮新的针对性极强。4. 一句话分清KD和OPD的核心区别其实本质差别一句话就能说清KD复制知识OPD复制判断。4.1 底层逻辑完全不一样KD学的是token概率分布损失用的是KL散度。OPD学的是回答排序损失用的是偏好函数。KD的老师是固定的提前生成完数据就没事了。OPD的老师全程参与训练每一轮都要实时输出判断。KD面向的是知识正确性OPD面向的是人类偏好对齐。4.2 举个最接地气的例子就像找工作面试。KD是背面试题库每道题的标准答案都背得滚瓜烂熟。OPD是面试官给你复盘告诉你这么答更讨喜、那么答容易踩雷。死背答案的人遇到新题直接懵学会判断的人啥题都能答到点子上。5. 说点干的底层逻辑其实很简单5.1 核心就是成对比大小说出来大家可能不信OPD的损失函数底层就一个朴素思路成对比较。拿出一个优选回答和一个较差回答模型要学会给好的打高分差的打低分。这个建模思路叫Bradley‑Terry模型听着高大上本质就是比谁更优。RLHF的奖励模型、DPO的目标函数根子上都是这个逻辑。5.2 为啥必须加约束不然模型会耍小聪明这里有个经典的坑很多团队都踩过。如果不加任何约束模型会耍鸡贼它把自己的输出方差拉得特别大。反正只要好的那个概率更高、差的更低损失就能降下来至于整体生成质量不管。就像考试为了超过同桌不是自己提分而是想办法让同桌考砸。所以真实训练里都会加个KL约束也就是参考策略正则不让模型跑偏太远。6. 工业界为啥突然都拥抱OPD了说白了无外乎成本和效果的账终于算过来了。6.1 第一RLHF实在是太贵了完整的RLHF流程训奖励模型、跑PPO强化学习工程复杂度直接拉满。调试成本、算力成本都高得吓人单模型还好模型矩阵一大根本扛不住。现在谁家没个7B、14B、32B、70B全家桶每个都走一遍RLHF财务看了都摇头。6.2 第二高质量标注越来越难找以前模型能力弱普通标注员就能分出回答好坏。现在模型越来越强代码、数学这些专业场景普通标注员根本分不清高下。高质量标注越找越贵供给还越来越少边际成本蹭蹭往上涨。6.3 第三学霸本身就能当裁判现在顶级大模型的判断力其实已经超过普通人类标注员了。人家自己就是经过层层对齐练出来的本身就是个现成的隐式奖励模型。放着这么好用的裁判不用再花钱找人标注属实是有点浪费资源。6.4 第四小模型越出越多批量复制更香一个大老师能带一堆不同尺寸的小学生。只要老师持续输出排序信号多少个学生都能同步跟着学。学生数量越多平均成本越低规模化的优势特别明显。7. 真实工业玩法用顶级模型带小模型7.1 为啥不直接用顶级模型用不起啊很多人说既然老师这么强直接用老师上线不就完了朋友按token计费的闭源API高并发场景跑一个月成本能给你惊掉下巴。而且延迟还不可控对方服务器啥负载你根本管不着私有化部署更是想都别想。小模型就不一样了自己部署、自己调优延迟成本全攥在自己手里。OPD的妙处就在这用一次训练的老师调用成本换一个能长期低成本运行的模型。老师只需要当裁判不用上场干活脏活累活全让学生干。7.2 一条能一直传下去的偏好链更有意思的是这份判断力是能逐级往下传的。顶级大模型教给中模型中模型再教给小模型小模型还能教给更小的。模型尺寸一级比一级小推理成本一级比一级低但“什么是好回答”的判断能一直传递下去。就像门派传武功掌门传给长老长老传给弟子核心心法一直没变。8. 别搞混RLHF、DPO、OPD到底啥关系很多人对着三个概念犯迷糊其实一句话就能分清各自定位。RLHF是先训练一个会打分的老师再用这个老师去优化学生。DPO是不用单独训老师了直接用偏好数据把学生教会判断。OPD是已经有个满级老师了直接让他把打分能力教给新学生。简单总结RLHF造老师DPO简化造老师的流程OPD是老师直接批量带徒弟。9. 也不是万能的优势和坑都得说9.1 好处是真的香首先对齐效果确实好直接冲着人类偏好优化不是只盯着知识点对不对。安全性也更容易把控合不合规、有没有风险直接编进排序标准里。还有风格、语气这些主观的东西传统KD学不来OPD能很好地传递过去。9.2 坑也真不少首先老师成本不低每一轮训练都要调用轮数多了也是笔不小的开支。然后排序本身就有主观性同一个问题老师这次和上次的判断可能都不一样。在线训练的工程复杂度也高生成、打分、参数更新串成闭环比离线蒸馏麻烦多了。还有就是偏好漂移不加约束很容易越训越偏最后输出质量直接崩盘。10. 最后收个尾传统蒸馏解决的问题是“让小模型知道更多”。OPD解决的问题是“让小模型判断得更好”。大模型卷到今天知识储备早就不是核心壁垒了。真正拉开差距的是对齐能力是价值判断能力。而OPD就是把这种能力批量复制的工程落地方案。以后大模型的竞争说白了就是谁的判断力能更低成本、更快地复制到各种尺寸的模型里。P.S. 无意间发现了一个巨牛的人工智能教程非常通俗易懂对AI感兴趣的朋友强烈推荐去看看传送门https://blog.csdn.net/HHX_01