
过来人一句实在话2025年秋招的联想数据类笔试筛人比你想的狠但题型比你想的稳。每年都有大量同学把精力全砸在算法题上结果开考半小时被行测和性格测试打了个措手不及也有同学专业基础很扎实却因为不熟悉在线笔试平台的规则白白被判定作弊。这篇内容就围绕联想数据类笔试的完整备战过程来写涵盖岗位定位、笔试题型配比、高频考点、Python和爬虫实操类题目以及我踩过坑之后的三十天复习路线。无论你目标是数据分析、数据开发还是数据产品这篇文章都能帮你把信息差补上。1. 第一关到底卡在哪联想数据类笔试的定位与岗位细分1.1 数据类岗位并不是一张卷子走天下很多人一听“数据类笔试”以为所有方向共用一套题这是个非常危险的误解。联想秋招的数据类岗位大体能拆成几个方向数据分析、数据开发、数据挖掘、数据产品偶尔还有偏业务的商业分析。虽然都是“数据”两个字但笔试侧重点差异明显。数据分析岗偏业务思维SQL和大数理统计是重头戏机器学习是加分项。数据开发岗偏工程能力数据结构、Python/Java编程、数据库原理、大数据组件Hadoop、Spark都有可能出现。数据挖掘岗偏算法建模机器学习、特征工程、模型评估是核心SQL也会考。数据产品岗相对特殊笔试通常偏产品逻辑和数据分析基础技术深度要求低一些但沟通表达和业务敏感度要求高。我当时投的是数据分析方向所以下文会以这个角度为主线穿插其他方向可能出现的差异点。如果你投的是开发岗编程题的权重会明显上升建议把LeetCode刷题量往上提一档。1.2 笔试在秋招流程中的真实位置整个联想秋招流程一般是网申投递 → 在线笔试 → 面试通常两到三轮→ offer审批。笔试是第一道硬过滤器通过率并不高。按照往年经验投递数据类岗位的候选人里至少有一半会被笔试环节筛掉有些竞争激烈的方向甚至更残酷。这里还不是说你专业题全对就稳了因为笔试成绩通常综合行测、性格、专业三部分任何一块出现明显短板都可能拉低总分。如果给笔试一个定位它是“性价比极高的筛选器”。对HR来说笔试能快速过滤掉不匹配的候选人对求职者来说笔试是少数可以通过短期突击大幅提分的环节。很多同学面试表现一般但笔试分很高照样能进入下一轮。反过来面试能力再强笔试挂了就是挂了。1.3 与互联网大厂笔试的差异化印象和互联网大厂比如腾讯、阿里、字节的笔试相比联想的题目风格更“稳重”不会出特别刁钻的偏题怪题但它覆盖面很广时间紧凑。大厂笔试往往以编程题和算法题为主导甚至整场都在写代码联想则更接近传统校招笔试的“综合素质 专业知识”组合有点外企风格。这种风格给复习带来的启示是不能只刷LeetCode还要分配出时间做行测题、复习统计学概念、准备SQL。如果你原本只按互联网大厂的标准准备到了联想笔试可能会觉得“考的怎么这么杂”。我见过一个算法很厉害的同学行测时间没控制好资料分析题连蒙带猜最后总分被拉得非常难看。2. 从投简历到笔试题到手那些容易被忽略的流程细节2.1 投递时间窗口与渠道选择联想秋招一般分提前批和正式批。提前批通常在7月中旬开启笔试安排会更早部分岗位甚至免笔试直接进面试正式批9月集中开放10月开始陆续笔试。无论走哪一批我都建议尽早投递一是岗位余额充足二是心理压力小。投递渠道上官网投递是主力。内推码在联想的权重不算低能找到在职员工内推的话简历会被优先查看但笔试该做还是得做不会因为内推就免笔试。牛客网、应届生论坛上每年都有内推码帖子渠道很多注意辨别真假就行。2.2 在线笔试平台的那些隐藏规则联想的在线笔试通常借助第三方平台比如北森、智鼎、牛客甚至部分岗位用SHL这类外企系统。不同平台的操作习惯差异很大开考前一定要提前熟悉。我那次用的是北森系统几个关键点到现在都记得全屏监控开启切屏超过一定次数会被警告严重的直接判定作弊。我建议开考前把所有弹窗软件、聊天工具全部退出尤其是那些会在右下角突然弹广告的软件。部分平台允许自带草稿纸但摄像头画面里不能出现手机、电子设备。浏览器兼容性是个大坑。有的平台只支持Chrome或Edge用Safari可能白屏开考前务必要做一次官方提供的模拟测试别嫌麻烦。网络问题。校园网在高峰期会抖动一旦断网可能导致答题记录丢失。有条件的话用手机热点做备用方案或者找个网络稳定的环境。这些细节看着小但每年因为切屏被警告、因为浏览器不兼容打不开卷子而翻车的人真的不少。2.3 笔试通知的接收与确认投简历后的一段时间要每天检查邮箱和短信垃圾箱也顺手翻一翻。笔试通知一般提前2到3天发放里面会说明考试时间、考试时长、链接和注意事项。收到通知后务必点击邮件中的“确认参加”或“确认链接”很多同学忽略这一步等到考试当天发现没有进入端口才慌慌张张找HR但往往已经来不及了。还有一点笔试时间有时会和一些目标公司的面试冲突。如果遇到这种情况可以尝试发邮件说明情况请求调整联想的HR整体比较人性化但不保证一定成功。所以收到通知第一件事还是先确认再把时间在日历里锁死。3. 行测、性格测试与专业题的配比陷阱别死在非技术题上3.1 一场笔试里最容易失控的两个板块我拿我自己那场举例系统里分了三个大的部分先是约30分钟的性格与情境测试再是约40分钟的综合能力测试行测最后是约50分钟的专业知识测试。整体时间看似够用但行测部分每题限时单个板块倒计时结束自动跳转不给返回修改的机会。这种设计催生了一个经典翻车场景前面的行测因为犹豫不决耗时过多后面专业题明明会做时间却不够了。行测的具体题型包括言语理解与表达、逻辑推理、数量关系、资料分析。其中数量关系和资料分析是重灾区计算量不小靠心算硬怼必然超时。逻辑推理里的图形推理题也容易卡壳盯着屏幕两分钟看不出来规律是常态。我的策略是遇到超过60秒没思路的题立刻从选项里挑一个看得顺眼的然后果断下一个。笔试是整体得分游戏单题失分不可怕整体完不成才可怕。3.2 性格测试别小看它的筛人能力性格测试在很多人眼里就是“随便选选”这是另一个大误区。联想的性格测试通常是情景选择和量表打分混合很多题目前后会以不同说法重复出现用来检测答案一致性。如果你前面选了“非常喜欢团队协作”后面又说“更喜欢独自完成任务”这类前后矛盾会被系统标记为乱答直接影响测评可信度。更隐蔽的陷阱是“理想我”与“真实我”的博弈。有些同学为了迎合大厂价值观强行把自己往“全能型、极客型”方向选结果选项极端化严重要么被判定不够真实要么与自己投递岗位的核心特质不匹配。数据类岗位通常看重的是严谨、逻辑性、抗压能力、合作意识。选的时候围绕这些关键词适度靠近但不要每个题都选最高分。3.3 专业题出现前先学会给行测“锁预算”各平台的时间分配规则不完全一样但“锁预算”的思路是共通的。开考后我会在草稿纸上先写下硬性时间表性格测试严格控制在系统给的时间内不纠结。行测总共40分钟拆成四个小板块言语10分钟、逻辑10分钟、数量10分钟、资料10分钟板块内超时就放弃。专业题留足50分钟这是争取高分的主战场。实际上由于每个板块都单独倒计时你能做的不是跨板块借时间而是在板块内部学会“抢时间”。行测里最需要抢时间的是资料分析计算密集容易上瘾。永远要提醒自己后面还有50分的专业题在等着你。4. SQL、统计学、机器学习三座大山高频真题拆解与得分策略4.1 SQL必考而且考得越来越实用联想数据类笔试基本都会涉及SQL考察形式包括选择题和手写查询语句。手写题通常给你两张或三张业务表要求写SQL完成某个统计口径。高频考点高度集中翻来覆去就是那几类多表连接inner join / left join / right join 的区别与使用场景。分组聚合 条件过滤where 与 having 的先后逻辑。窗口函数row_number() / rank() / dense_rank() 的区别以及配合 partition by 做组内排序。去重计数count(distinct column) 对空值的处理。日期处理date_format、datediff、date_add 等常见函数的用法。我印象里比较典型的一道笔试题是“查询每个部门最近一个月内入职且薪资排名前3的员工信息”。表面看是普通的组内取TopN实际上考查的是窗口函数。用group by 取 max(入职时间) 也能做但写完又长又容易错窗口函数只需要一个子查询加row_number()就解决了。再提醒一点手写SQL时注意别丢分项——字段名大小写、分号、列名是否与原表一致。在线笔试不是本地IDE往往没有自动补全写错列名就只能白白丢分。4.2 统计学从定义理解到场景应用统计学题目也是联想数据类笔试的重头戏尤其数据分析方向。高频知识点如下均值、中位数、众数、方差、标准差的基本计算与适用场景。概率论基础条件概率、贝叶斯定理、常见分布正态、二项、泊松。假设检验流程原假设与备择假设设定、p值含义、显著性水平、第一类错误与第二类错误。置信区间点估计与区间估计的区别置信水平的含义。相关性与因果性相关系数取值范围不能把相关当因果。很多题不是直接让你算而是放在业务场景里考。比如“某产品改版后新用户次日留存率从20%提升到22%需要验证这个提升是否显著应该用什么方法”答案方向是双样本比例检验但选项里会混着卡方检验、t检验、方差分析这时候就得把检验的适用条件搞清楚不能只会喊“p 0.05就显著”。我的复习建议是把统计学里的“检验类型与适用场景”对照表反复看几遍。不一定能精确到公式级别的计算但一定要能在场景里选出正确的方法。联想笔试的统计学题目偏向概念判断和场景选择真正的复杂推导不多。4.3 机器学习高频但通常不深机器学习在数据类笔试里一定会涉及但难度普遍是“概念级”或“结果分析级”很少出现手推公式的题目。常见考点包括过拟合与欠拟合表现、原因、缓解手段正则化、交叉验证、数据增强、降低模型复杂度。模型评估指标准确率、精确率、召回率、F1、ROC曲线、AUC值的含义与适用范围尤其是类别不平衡时为什么不能只看准确率。偏差与方差两者权衡怎么理解。监督/非监督学习常见算法归类K-Means是聚类不假但K-Means里K怎么选、初始质心怎么定这些都是可能的点。特征工程缺失值处理、归一化/标准化、离散化、特征选择的基本思路。举个例子笔试里出现过一道题“在信贷违约预测中正样本占比只有1%模型预测准确率达到98%但这个模型可能没有实用价值为什么”答案是全部预测为负样本也能得到99%的准确率准确率严重失真应该看召回率和AUC。这类题目考查的不是你有没有背过公式而是能不能在真实场景里识别评估指标的陷阱。复习机器学习时我建议少看纯理论推导多刷带场景的选择题把每个知识点的“为什么”搞明白。5. Python编程与数据分析实操题从数据清洗到异常值处理5.1 编程题风格不硬核但很“数据”联想笔试里的Python编程题不像互联网大厂那样只考纯算法更多是围绕数据处理来出题。常见形式有两种给定一段有bug的代码要求选出正确输出或修正。给一个数据处理需求要求写一段完整的Python代码。第一种形式很阴险因为你不仅要读懂代码还得对Python的语言细节足够敏感。比如可变对象与不可变对象的区别、列表切片是否改变原列表、for循环中变量作用域问题这些都是出题人喜欢埋坑的地方。我碰到过一道题用列表的 append 方法在一个循环里添加字典对象最后输出一堆相同的值——这是因为字典是可变对象循环里反复引用同一个内存地址所有元素最终都指向最后的状态。这种坑没遇到过的人现场基本想不出来。第二种形式通常和pandas紧密相关。比如给你一个销售记录表结构包括订单ID、用户ID、商品类目、销售额、下单时间要求写出“统计每个用户消费频次最高的商品类目”的代码。这种题不要求最优解但要求逻辑清晰、代码能跑。用 value_counts idxmax 或者 groupby 都能做重点是把过程写清楚。5.2 pandas高频操作清单如果你主攻数据分析方向下面这些pandas操作必须做到条件反射读文件pd.read_csv() 的参数怎么用比如 encoding、parse_dates。缺失值处理isna()、dropna()、fillna() 三件套以及 fillna 时 methodffill 和 bfill 的方向差异。数据筛选df[df[列名] 阈值]、loc、iloc 的区别。分组聚合groupby agg({列名: [sum, mean, count]})。排序sort_values(by, ascending)。合并pd.merge 的各种连接方式对应SQL里的各种join。时间序列to_datetime、dt.year、dt.month、resample。笔试现场的代码环境通常没有本地IDE那么友好可能只是代码编辑器没有提示和自动补全。平时练习的时候就要切换到“不依赖补全”的状态核心方法名和常用参数要用到肌肉记忆。5.3 异常值和缺失值的处理逻辑数据清洗类实操题里最容易拉开分数的是对“异常值”的处理。笔试题目不会只让你 fillna(0)而是会问该不该补用什么补为什么我的处理思路是这样的先判断缺失机制。完全随机缺失、随机缺失、非随机缺失补法不一样。数值型变量正态分布时用均值填充偏态明显时用中位数填充有时候用前后值填充时间序列更合理。分类变量可以用众数也可以单独分为一类“未知”。不要为了做题而做题要在答案里展现你的判断依据。异常值检测也是常考内容。Z-Score方法适合近似正态分布的数据IQR方法更加稳健适合偏态数据。笔试题如果给了一个带离群点的收入分布直接问“哪种方法更适合检测异常值”答案选IQR的概率要远大于Z-Score因为收入分布通常右偏严重均值和标准差容易被极端值拉偏Z-Score就会失真。6. 爬虫类题目为何频繁出现以::after伪类数据抓取为例6.1 数据类岗位笔试为什么会考爬虫明明是笔试怎么还考爬虫很多同学一开始不理解。其实对数据类岗位来说数据获取能力是基本功。笔试里出现爬虫类题目通常不是为了让你写一个完整的爬虫而是考查你对网页数据采集的底层机制是否了解。这类题通常以两种形式出现一种是选择题给你一个网页场景问你用什么方法能提取到某段内容另一种是简答/代码题让你写一个数据采集方案。即使没有爬虫专场的笔试面试中也大概率会被问到“如果数据是从网页上采集的但网页上没有接口你怎么获取”。这里就引出了热点话题DOM被伪类after修饰过的数据要怎么爬。6.2 什么是伪类 ::after 修饰的数据为什么它爬不到正常情况下我们看到的网页文本都在HTML源码里用 requests 请求后再用 BeautifulSoup 提取文本就能拿到内容。但有一种情况非常坑页面上的文字看似存在实际上是通过 CSS 伪元素 ::after 的 content 属性渲染出来的。伪类 ::after 是CSS中的一种伪元素它可以在元素的末尾插入一段内容。举个例子有一段HTMLspan classprice>.price::after { content: attr(data-price) 元; }这种情况下你用 requests BeautifulSoup 去解析HTML只拿得到“商品价格”这几个字拿不到伪类里生成的“299”。因为伪类生成的内容是在浏览器渲染阶段才合成的根本不存在于原始HTML源码中。很多反爬手段就利用了这一点页面上的关键数据价格、号码、验证码字符通过伪类动态渲染爬虫直接抓HTML就是一堆残缺信息。数据类岗位笔试里如果出现这个场景考点就是“你知不知道浏览器渲染和DOM原始树之间的差异”。6.3 破解伪类数据抓取的几种可行思路笔试时问到这个场景不要慌解决方案是有套路的。核心思路是既然伪类内容是在浏览器渲染后才出现的那我们就模拟浏览器去取渲染后的结果。方案一Selenium / Playwright 模拟浏览器渲染用无头浏览器加载页面等CSS渲染完成后直接取元素的文本内容。这种方式最直观伪类生成的内容和真实浏览器里看到的一致。from selenium import webdriver from selenium.webdriver.common.by import By driver webdriver.Chrome() driver.get(https://example.com) text driver.find_element(By.CLASS_NAME, price).text print(text) driver.quit()Selenium 能拿到是因为它操作的是完整的浏览器渲染引擎不是简单读HTML源码。方案二用 getComputedStyle 获取伪类样式如果页面逻辑比较简单不需要完全模拟浏览器可以只让浏览器执行一段JS读取伪类的 computed stylelet content getComputedStyle( document.querySelector(.price), ::after ).content; console.log(content);在 Selenium 里通过 execute_script 执行这段JS就能拿到伪类里注入的内容。这种方式比直接取text更精准适合知道元素和伪类结构的情况。方案三直接解析外部CSS文件有些网站会把 content 内容写在单独的CSS文件里尤其是价格反爬。这时候可以用 requests 请求CSS文件再用正则或者CSS解析库提取 content 字段。比如import re css_text requests.get(https://example.com/style.css).text match re.findall(r\.price::after\s*\{\s*content:\s*[\]([^\])[\], css_text) print(match)这个方案的优点是效率高、不用启动浏览器缺点是需要先定位到CSS文件遇到content是动态变量比如 attr()函数时会失效。方案四观察接口直接绕过渲染层其实很多动态渲染的数据底层都会有一个异步接口返回JSON。如果能在Network面板里找到真实的数据接口直接请求接口拿数据就不存在伪类问题。笔试答题时如果能提到这个思路是很加分的这体现的不是死板的爬虫技术而是对数据链路的整体理解。顺便说一句爬虫类题目里如果涉及到数据采集一定要在回答时体现出合规意识。比如“只爬公开数据”“遵守robots协议”“不涉及个人隐私数据”——这几个点主动写上在专业性之外还能给面试官留下谨慎的印象。涉及爬虫法律法规的内容我就不展开了你要记住的是任何数据采集方案都必须建立在合法合规的前提下。6.4 笔试里这类题的答题模板如果笔试给了一道简答题“一个网页的价格信息通过CSS伪类::after动态生成请你设计一个数据采集方案并说明步骤”我的建议是分四步作答描述问题本质伪类生成内容不在DOM原始树中普通HTTP解析抓取不到。提出主要方案推荐Selenium/Playwright无头浏览器渲染页面用text属性或getComputedStyle获取内容。给出备用方案若页面结构固定可解析CSS文件定位content字段若数据来源是异步接口优先直接请求接口。说明风险与对策注意页面反爬、请求频率限制、合规边界。这套回答结构既展示了原理理解又给出了可落地步骤部分条件下还能写出关键代码段。笔试评分时这种“有层次”的回答通常比只写一句“用Selenium”拿的分高得多。7. 三十天备考路线与临场避坑清单7.1 分阶段复习路线基础盘点、专项突破、模拟冲刺如果你手头还有三到四周时间完全可以按下面的节奏走一遍覆盖得比较完整。第一阶段第1-10天基础盘点。先做一次模拟卷摸底知道自己当前的水平在哪里。然后集中过统计学基础描述统计、概率、假设检验、SQL常用语法、Python编程基础和pandas常用操作。这个阶段不要贪多重点是“把会用的概念捡起来”。行测不用专门练几天每天做30题保持手感就够。第二阶段第11-20天专项突破。针对自己薄弱项发力。如果SQL不熟每天手写15道SQL题重点练窗口函数和多表join如果机器学习的评估指标概念混乱找经典选择题集反复刷如果爬虫类题目没把握就练习用Selenium模拟渲染页面把上面说的 ::after 伪类的场景亲手实现一遍。这个阶段要敢于暴露短板反正还没上考场错得越多学到越多。第三阶段第21-30天模拟冲刺。按真实笔试的时间限制完整做套题严格卡时间不中途暂停。做完后复盘重点看时间分配是否合理、失分点集中在哪里。最后3天不再做新题只看错题总结和笔记。7.2 临场避坑清单照着做能少丢20分这几个坑是每年反复出现的我按重要性列个清单开考前测试摄像头和麦克风不通过是进不了考试系统的。关掉所有弹窗类软件和输入法自动更新防止中途切屏风险。身份证/学生证放在桌边有些平台开考后需要拍照验证。草稿纸多准备几张行测的计算题非常耗纸。性格测试前后保持一致不要刻意把自己塑造成“完人”。行测遇到卡壳题60秒没有思路就猜一个然后坚决下一题。SQL题写完后检查一遍分号和字段名。Python手写代码没有IDE提示函数名写错很难发现平时练习就要留意拼写。时间剩余超过10分钟时回头检查是否有漏题而不是提前交卷。7.3 笔试结束后别松得太早笔试提交后系统通常不会立刻显示分数需要等1到2周。这段时间不是让你躺平而是该开始准备面试了。联想的面试流程一般包括业务面、HR面和现场/远程的案例分析。笔试里考过的SQL、统计、数据清洗知识面试中99%还会出现只是换了个更贴近业务的形式。比如面试官可能说“假如我们某条产品线的转化率下降了你怎么分析”这其实就在考你数据思维和笔试里的业务场景题是同源的。所以笔试结束后建议你快速做两件事一是把笔试中不确定的题目整理出来回头查找正确答案把知识缺口补上二是提前准备一个自己做过的小型数据分析项目哪怕是课程设计也行梳理清楚项目背景、你做的工作、用到的模型和分析结论。面试阶段会非常有用。我个人走完这一轮秋招笔试最深的感受是联想数据类笔试的难点不在于题有多深而在于它考验的是综合素质的稳定输出。你既得有扎实的SQL和统计学功底又得能在行测的时间压力下稳住心态还得对爬虫、数据获取这类工程问题有足够的知识储备。别被“数据类”三个字吓住把这条路一条条走明白笔试这一关完全可以稳稳拿下。