阿里巴巴淘宝的推荐系统,是怎么用AI读懂你的购物心思的?

📅 发布时间:2026/7/29 19:52:15
阿里巴巴淘宝的推荐系统,是怎么用AI读懂你的购物心思的? 这项由阿里巴巴淘宝技术团队完成的研究于2026年7月以技术报告形式公开发布论文编号为arXiv:2607.15591有兴趣深入了解的读者可以通过该编号查询完整论文。每次打开淘宝首页你看到的那些猜你喜欢商品背后其实有一套极其复杂的大脑在运转。这套大脑不只是在统计你点击过什么、买过什么而是在真正理解你为什么点推断你此刻最可能需要什么。这听起来有点科幻但阿里巴巴的研究团队已经把它做成了现实——而且是服务着数亿日活跃用户的真实系统。这篇报告介绍的是他们最新一代推荐系统RecGPT-V3的完整技术方案。要理解它的价值得先理解它的前辈们解决了什么、又留下了哪些麻烦。RecGPT-V1是第一个把大型语言模型也就是类ChatGPT的AI真正放进推荐流水线的版本让系统从你买过A所以给你推A类似的B变成你买A是因为你在追求某种生活方式所以给你推能满足这种生活方式的C。RecGPT-V2在此基础上引入了一个规划者多个专家的协作架构就像一个主编带着多个专栏作者各司其职地分析用户的不同兴趣维度。两代系统都已在淘宝主页部署带来了可观的用户体验和商业指标提升。然而当这套系统在真实的亿级用户规模下运转时三个根本性的问题暴露出来每一个都像是绊脚石卡住了系统进一步变好的路。研究团队花了大量精力识别、描述并解决这三个问题这也是RecGPT-V3这篇报告最核心的贡献所在。最终的成绩单相当亮眼在淘宝首页猜你喜欢场景的大规模线上A/B测试中RecGPT-V3相比RecGPT-V2实现了商品页面浏览量提升1.28%、点击率提升1.00%、成交量提升1.97%、成交金额提升3.97%同时端到端的服务计算成本降低了52.4%。效果和效率同步改善这在工业级AI系统里并不常见。---一、三块绊脚石系统在哪里卡壳了以一个热爱羽毛球的用户为例。他在过去两年里点击、收藏、购买了各种羽毛球装备还买了一些数码产品和婴儿用品。每次他打开淘宝RecGPT-V2的规划者就要把他这两年所有的行为记录从头到尾重新读一遍然后分析他的兴趣偏好再决定推什么。这就是第一个问题研究团队称之为无状态行为建模。对于一个活跃用户来说两年的行为记录可能多达数万条操作翻译成AI处理的文字大约是五万个词token。每次请求都重新处理这五万个词不仅浪费巨大还从根本上忽视了一个事实很多东西上次分析完就已经知道了根本不需要再推导一遍。更深层的问题在于系统每次都是从零开始无法积累对用户的理解就像一个每次见面都要重新自我介绍的朋友永远停留在陌生人阶段。第二个问题叫标签到商品的信息瓶颈。RecGPT-V1和V2的工作方式是AI分析完用户后输出一些自然语言标签比如旋转可调羽毛球拍支架然后由另一个下游模型根据这个标签去商品库里找匹配的实物。问题在于旋转可调羽毛球拍支架这个描述对应的商品可能有成千上万件良莠不齐什么价位、什么品牌、什么款式全都混在一起。语言文字本质上是模糊的无法精确指向某一类具体商品。这就像你告诉导购我要一件好看的衣服导购只能给你看一个巨大的试衣间里面什么都有帮助有限。第三个问题叫显式推理效率低下。为了真正理解用户意图AI需要进行多步骤的推理也就是业内说的思维链先分析用户是什么类型的人再推断他最近可能在关注什么再结合当前的季节、趋势最后才输出推荐。这个推理过程平均需要生成大约三千个词耗时长、计算重在亿级用户同时在线、每秒请求量极高的场景下成本根本撑不住。但如果直接砍掉推理过程推荐质量就会明显下降而且系统会变成一个黑盒谁也不知道它为什么推这个商品。RecGPT-V3针对这三个问题分别提出了三套解决方案记忆中枢、混合模态推荐基础模型以及潜在意图推理。下面一一拆解。---二、记忆中枢让系统拥有真正的用户档案以往的系统就像一个没有记事本的客服每次接待你都从头问起记忆中枢的目标是给系统配上一本随时更新的用户专属档案。具体做法是这样的第一次处理某个用户时系统会把他所有的历史行为读一遍然后把这些行为提炼成一组结构化的记忆单元。每个记忆单元对应用户的一种行为模式比如羽毛球爱好者数码发烧友新手爸爸。每个单元包含两个核心内容一个是模式的名称来自一个预先设计好的、涵盖主要电商行为类型的分类体系另一个是自然语言写成的偏好描述比如钟情全碳素进攻型球拍近期从天斧系列转向了更高端的款式。此外每个单元还记录着它是从哪些原始行为推导出来的——这一点很关键保证了系统的可解释性出了问题能追溯。这个提炼过程能把五万个词的行为历史压缩成几个简洁的记忆单元token数量减少了94.5%。此后系统处理这个用户时只需要读这些精炼的记忆单元加上他最近几天的新行为就够了不用再翻那本厚厚的老账。但用户的兴趣是会变的。研究团队把这种变化分成了三种情况并设计了相应的处理机制统称为渐进式记忆整理。有些记忆单元需要更新比如用户原来关注的是0到6个月婴儿用品但最近开始买6到12个月的产品说明孩子长大了记忆单元就把0-6个月这个描述更新为6-12个月并补充上新出现的学步车、早教玩具等偏好。有些记忆单元不需要动比如他对户外跑步的兴趣没有任何新的行为支撑那就保持原样不干扰它。还有些行为是全新的不属于任何现有单元比如他突然开始搜索和购买宠物用品那就为他新建一个新手铲屎官的记忆单元。在论文给出的案例中一个用户在2025年底的记忆单元包含科技数码、羽毛球、家居三个维度。到了2026年中经过渐进式整理后科技维度更新为定制键盘和折叠手机羽毛球维度更新为Astrox系列球拍家居维度保持不变同时新增了一个跑步维度记录了他开始关注Saucony和HOKA品牌。整个过程不需要重读原始历史记录只基于最新的行为增量进行局部更新。在实际部署中这个记忆整理每两个月运行一次。最终效果是全局规划者负责分析用户意图的主模块的计算成本降低了55.8%。研究团队还对记忆单元的质量做了大规模人工标注验证2514条行为模式标注的准确率达到82.89%21268条行为索引的准确率达到95.27%说明系统产生的记忆单元确实是可靠的。---三、混合模态推荐基础模型给AI装上商品语言解决了记忆的问题第二个要攻克的是语言标签到实际商品之间那道信息鸿沟。研究团队提出的解决思路很直接与其让AI说我要推带旋转架的羽毛球拍支架然后让下游系统去猜不如让AI直接说出具体商品的编号。他们为此创造了一种叫做语义IDSemantic ID简称SID的东西。语义ID的核心思想是把每件商品用一串数字编码来表示但这串数字不是随便分配的而是根据商品的实际内容和用户行为特征来生成的使得语义相似的商品拥有相似的编码。就像邮政编码一样北京的邮编都以10开头上海的都以2开头——只要看编码你就大致知道这件商品在商品世界的哪个区域。生成这套编码分两步走。第一步是让每件商品产生一个综合了文字、图片和属性信息的统一特征向量。系统用CN-CLIP这个多模态编码器分别处理商品的标题、主图和侧边属性然后通过一个叫Q-Former的融合模块把三路信息整合成一个向量。为了让这个向量真正反映商品之间的相似关系训练时采用了对比学习凡是在用户行为中频繁共同出现、且内容也确实相近的商品对就当作正样本来训练让它们的向量靠近其他商品当作负样本让向量远离。第二步是把这个连续的特征向量量化成离散的编码用的是一种叫RQ-VAE的残差量化技术。最终每件商品得到两个编码合称语义ID例如某款音箱的语义ID是。第一个编码代表粗粒度的语义类别第二个编码在该类别内进一步区分。系统总共引入了65536个新的语义ID词元扩充进了语言模型的词汇表。有了这套编码系统下一步是训练AI真正理解并会使用这些编码这就是混合模态推荐基础模型的训练过程分两个阶段完成。第一阶段叫持续预训练主要目标是让模型记住每个语义ID代表什么商品。训练数据的主体约90%是一种ID-商品配对样本格式大致是语义ID 对应的商品是标题为XXX类目为XXX价格为XXX。通过大量这样的配对训练模型逐渐建立起语义ID和商品内容之间的对应关系。剩余约10%的训练数据来自通用领域包括数学推理、编程、科学文献等目的是防止模型在学了大量电商专业知识后把原本的通用能力给忘掉——这个现象在AI领域被称为灾难性遗忘是个老大难问题。第二阶段叫指令微调目标是让模型学会在各种任务场景下灵活运用语义ID。训练任务覆盖了六种不同的映射方向从语义ID生成商品标题、从商品标题预测语义ID、从语义ID生成搜索标签、从搜索标签预测语义ID、从语义ID预测商品类目以及完全在语义ID空间内做序列推荐根据用户的点击历史ID序列预测下一个可能点击的商品ID。每种任务占整体训练数据的比例都经过精心调配通用领域任务占约20%以维持模型的综合能力。在效果验证上研究团队设计了一系列评测。在通用能力保留方面混合了通用数据的版本在GSM8K数学题测试上只下降了1.66个百分点在MMLU综合知识测试上下降了2.65个百分点在CMMLU中文语言理解测试上下降了4.49个百分点在IFEval指令执行测试上从81.52%降至75.60%——损失有限主要能力都保住了。而去掉通用数据的版本则几乎完全崩溃GSM8K只剩4.70分MMLU只剩0.12分近乎失去了推理和知识能力。在商品推荐质量方面混合通用数据的版本在类目命中率HR30指标上达到0.3050而去掉通用数据的版本只有0.2250差距明显。---四、潜在意图推理把长篇思考压进几个神奇的词即便有了精炼的用户记忆和语义ID推理过程本身仍然太慢。如何保留推理带来的质量提升同时把推理的时间成本压下来这是第三个要解决的问题也是RecGPT-V3最具技术创新色彩的部分。研究团队的核心思路是既然推理过程可以让AI产生更好的输出那我们就把这个推理过程内化进几个特殊的词元里让AI在推理时不需要把思考过程一个字一个字地写出来而是用这几个特殊词元在内部完成思考最后直接输出结论。这就好像一个围棋高手他的大脑在落子之前经历了深度的推算但他不需要把每一步推算都说出声来最终呈现给你的只是那手棋。具体实现上系统引入了一组全新的潜在词元记作z?, z?, ...z?这些词元本身不对应任何自然语言单词它们的含义完全是在训练过程中从推理数据里学出来的。每个潜在词元负责编码推理过程中的一个片段。整个推理轨迹被划分成若干个连续片段每个片段包含大约20步推理内容压缩进一个潜在词元。最多使用10个潜在词元对应最多200步左右的推理过程。但这些潜在词元初始化时完全是随机的噪声什么含义都没有。如何让它们学会编码推理内容研究团队设计了一套多粒度对齐训练机制本质上是一个解码还原游戏包含三种难度递增的关卡。第一关叫单段重建把推理链中的某一段替换成对应的潜在词元但其他所有段仍然保留完整文字然后要求模型把被替换的那段文字还原出来。由于上下文线索非常充足这是相对容易的主要作用是把每个潜在词元和它代表的推理内容建立初步的对应关系。第二关叫多段重建同时替换推理链中的几个片段要求模型同时还原这几段文字。难度明显上升迫使每个潜在词元在有其他词元存在的情况下仍然各司其职地编码好自己的信息。第三关叫全链重建把整条推理链的所有片段都替换成潜在词元模型面对的只有输入上下文、一串潜在词元和最终输出然后要求它把整条推理链从头到尾完整还原出来。这是最高难度的关卡通过它之后这串潜在词元就相当于对整个推理过程做了一次无损压缩随时可以解码还原。这种设计有一个特别重要的副产品可解释性。任何时候系统都可以把推理用的潜在词元解码还原成人类可读的文字推理过程。这意味着工程师在排查问题时不是面对一个完全不透明的黑盒运营人员在需要时也能看到系统为何推荐了某件商品。这在工业推荐系统里是很难得的特性。完成这套对齐训练后还有第二阶段的强化学习微调。RecGPT-V2用的强化学习奖励是命中率看模型推荐的标签能否命中用户实际点击的商品命中越多奖励越高。但研究团队发现这个奖励信号有两个缺陷一是太稀疏很多情况下同一组样本的奖励都一样导致学不到有效梯度二是这个奖励和真实的线上商业效果之间存在偏差因为模型输出的标签还要经过检索、排序等多道工序才会展现给用户。RecGPT-V3改用了一种叫排序反馈强化学习的新方案。对于模型输出的一组标签系统先用这些标签去检索候选商品然后把这些候选商品丢进线上的生产排序模型也就是实际决定商品展示顺序的那个模型打分取得分最高的前100件商品的平均分作为奖励。这个奖励信号解决了两个问题平均100件商品的分数比离散的命中率连续得多梯度信息更丰富从生产排序模型那里取奖励保证了训练目标和线上实际效果的一致性。在此基础上系统还保留了对齐分、多样性分和长度分三个约束条件只有当这三个指标都达到阈值时主奖励才生效防止模型为了刷高分而走捷径。---五、把三块拼图拼在一起系统全貌与实验结果记忆中枢、混合模态基础模型、潜在意图推理这三个部分在RecGPT-V3里是协同工作的。工作流程大致如下当用户访问淘宝首页时记忆中枢提供这个用户的压缩记忆单元加上他最近的行为序列一起送给全局规划者。规划者分析用户当前的意图把任务分配给若干个专领域的专家模型比如运动装备专家、数码产品专家、母婴专家。每个专家模型基于混合模态基础模型同时输出自然语言标签和语义ID两种形式的意图表达推理过程通过潜在意图推理机制大幅压缩。最后一个混合检索模型把文字标签和语义ID综合起来从商品库里找出最匹配的候选商品送入排序流水线。在计算成本结构上研究团队给出了详细的数据。引入语义ID和潜在意图推理之后专家模型的上下文变长了单个专家模型的计算成本比RecGPT-V2版本增加了约15%。但全局规划者的计算量比专家模型大约20倍而记忆中枢把规划者的计算成本削减了55.8%。两相权衡整体资源消耗降低了52.4%。换一个角度看RecGPT-V3使用的算力仅相当于RecGPT-V1的19%。在推理效率的具体数字上显式思维链版本的专家模型每个样本平均生成2840个词处理1000个样本需要1020秒潜在意图推理版本每个样本只生成122个词同样的1000个样本只需要295秒速度提升了3.46倍输出长度减少了95.7%。在推荐质量的逐步消融实验中各个组件的贡献也清晰可见。单纯的Qwen3-14B基础语言模型在类目命中率指标HR30上得0.2276开启内置思维链后只提升到0.2347说明没有领域知识的推理作用有限。加上混合模态基础模型的预训练之后HR30跳升到0.3050提升幅度最大。再加上显式思维链微调达到0.3508。用潜在意图推理替换显式思维链基本持平0.3462但推理效率大幅改善。最后加上强化学习HR30进一步提升至0.3693点击率指标CTR从0.0624提升至0.0679全面超过显式思维链版本。在文字标签和语义ID两种模态的互补性验证上研究团队做了专门的分析。文字标签的品类广度平均覆盖1.40个类目用户间的重叠度达到11.36%语义ID即使每个标签配了多个ID覆盖的类目平均只有0.84个用户间重叠度只有4.61%。这说明文字标签更具普适性和覆盖广度而语义ID则更能捕捉每个用户独特的个性化信号。把两种模态的检索结果合并后HR500从0.1539纯语义ID提升到0.1571HR1000从0.2144提升到0.2168两种模态确实是互补关系并集起来比任何一方单独工作都要好。---六、在淘宝线上跑出来的真实成绩所有这些技术创新最终都要接受真实流量的检验。RecGPT-V3在淘宝首页猜你喜欢场景部署后与RecGPT-V2并行运行了A/B测试实验组和对照组各承载1%的总流量以确保统计显著性同时控制风险。在纯商品推荐场景下提升幅度最为显著商品页面浏览量提升3.08%点击率提升0.98%页面浏览量提升2.02%成交量提升3.10%成交金额提升高达7.51%。成交金额的提升幅度远大于点击率说明推荐的商品不只是更容易被点击而是更符合用户的购买意图用户进入商品详情页后更愿意实际下单。在包含商品、广告、直播等多种内容类型的综合信息流场景下提升相对保守但依然全面商品页面浏览量提升1.28%点击率提升1.00%页面浏览量提升0.83%日活跃用户数提升0.56%成交量提升1.97%成交金额提升3.97%。日活跃用户数和页面浏览量的提升说明改善效果覆盖了广泛的用户群体而不只是在某个特定用户群里集中体现。---归根结底RecGPT-V3回答的是一个非常基本的问题推荐系统能不能真正理解用户而不只是统计用户答案是肯定的但要做到这一点需要解决一系列工程和算法上的真实挑战这篇报告详细记录了阿里巴巴团队解决这些挑战的完整路径。记忆中枢让系统从每次从零认识你变成了记得你的老朋友。语义ID让系统的理解结果和商品库之间建立起了精准的连接不再隔着一层模糊的语言翻译。潜在意图推理让深度思考不再是奢侈品把高质量推理的成本压缩到实际可部署的水平。三项创新都不是孤立的技巧而是针对工业推荐系统在大规模运营中暴露的真实瓶颈量身定制的解决方案而且每一项都在真实的A/B测试中得到了验证。这种从问题出发、到系统落地的完整链路是这项工作值得关注的地方。有兴趣深入研究细节的读者可以通过arXiv:2607.15591找到这篇完整的技术报告里面还包含了意图到商品检索模块的完整架构描述和潜在推理重建的示例案例。---QAQ1语义ID和普通的商品ID有什么区别为什么需要重新设计一套编码A普通商品ID只是一个数据库主键两个相邻的ID之间没有任何语义联系。语义ID则不同它是根据商品的实际内容特征和用户行为数据学出来的语义相似的商品会拥有相似的编码——相关商品共享同一个粗粒度编码就像同一区域的邮政编码前缀相同。这让AI模型可以通过编码本身就感知到商品之间的相似关系而不是把每件商品当成完全独立的个体大幅降低了从语言理解到商品检索之间的信息损耗。Q2潜在意图推理中的潜在词元能还原出来的推理文字和AI真正用到的思考内容是一样的吗A严格来说两者不完全等同。潜在词元编码的是从训练数据中学到的压缩表示还原出来的文字是模型对这个压缩表示的最优解码结果而非AI推理时字面上的中间步骤。但论文中给出的案例显示还原出来的文字在内容上与原始推理轨迹高度一致能够合理解释为什么推荐了某些商品。研究团队把这称为可解释性意思是虽然不是逐字还原但足以支撑工程和运营层面的可追溯需求。Q3记忆中枢的渐进式记忆整理每两个月才运行一次会不会错过用户的即时兴趣变化A这个问题在系统设计上有对应的处理方式。记忆中枢负责的是长期、稳定的兴趣模式例如用户是羽毛球爱好者、是新手爸爸。而最近几天甚至几小时的新行为系统会直接作为近期行为序列单独输入给推荐模型不经过记忆压缩。两条通路并行稳定偏好走记忆单元即时兴趣走原始序列。这样既避免了每次都重新处理全部历史的浪费又不会因为记忆更新周期太长而错过用户最新的兴趣信号。