网易2018数据分析笔试拆解:SQL、统计与业务思维仍是核心

📅 发布时间:2026/8/31 19:33:06
网易2018数据分析笔试拆解:SQL、统计与业务思维仍是核心 说实话2025年再看“网易2018校园招聘数据分析工程师笔试卷”这个标题很多人第一反应是“这题早过时了吧”。但我的看法恰恰相反。数据分析岗位的笔试考察的核心从来不是某个具体年份的“热点技术”而是你拆解问题的逻辑、对数据的敏感度、以及把业务问题翻译成数学问题的能力。这份卷子之所以值得翻出来反复琢磨是因为它出题严谨、覆盖面广涵盖了从SQL基础、概率统计到业务案例分析的完整链路。哪怕题库已经迭代了好几轮底层的能力模型和考察思路并没有变。对正在准备校招、或者想系统自查一下自己数据分析基本功的朋友来说这份“考古”材料反而是一份很扎实的复习清单。我当年准备校招的时候也刷过这份卷子的回忆版。工作几年后再回看才真正理解它每一道题背后想筛选什么样的人。这篇文章就围绕这份笔试卷拆解它考察的四大核心模块——数据提取、量化分析、业务洞察、工具落地把每类题型背后的原理、解题思路和实操要点逐层展开。我会结合自己面试和实际工作中的经验把“当时怎么做题”和“现在怎么做业务”对照起来讲尽量让不同基础的读者都能找到对自己有用的部分。1. 整体设计思路拆解网易到底在考什么1.1 笔试背后的能力模型一份笔试题目设计得好不好关键看它有没有围绕一个明确的“人才画像”来出题。网易2018年这份数据分析工程师笔试卷明显不是随手凑的题它的能力模型非常清晰数据提取能力、逻辑量化能力、业务理解能力、工程落地能力四个维度层层递进。笔试的一开始通常是SQL题和基础概率题这部分筛选的是“能不能干活”——能不能正确地从数据库里捞数能不能理解基本的统计概念。紧接着是相对复杂的统计推断和案例题这部分筛选的是“会不会思考”——给了你一个模糊的业务问题你能不能把它拆解成可量化的指标选对分析方法。最后往往还有Python编程或开放案例分析这部分筛选的是“能不能落地”——你的分析思路能不能用代码实现你的结论能不能指导业务决策。我当时拿到卷子翻完一遍最大的感受是它不是死记硬背就能过的考试。哪怕你把SQL语法背得滚瓜烂熟到了案例题该懵还是懵。这就说明网易想招的不是“写SQL的工具人”而是“有业务 sense 的分析师”这是整份试卷的底层逻辑。1.2 为什么这种考察结构值得借鉴笔试时间通常就一两个小时能出的题目数量有限。网易把题型分布在“硬技能软技能”两个维度上本质上是在用有限的时间做最高效的筛选。SQL和Python是硬技能短时间无法突击能筛掉一批“简历包装过度”的候选人。统计分析和业务案例则属于软技能考的是临场反应和思维模式能区分“背题型选手”和“真正做过分析的人”。这点對大家的参考意义在于准备任何一家公司的数据分析笔试不要只刷题而是顺着它的考察结构去构建自己的知识体系。我当时复习时就按这个思路把知识框架拆成几个模块逐个击破效果比漫无目的地刷几十套题好得多。这也是我在这篇文章里会反复强调的复习方法——从考察目标倒推学习重点。2. 核心细节解析与实操要点笔试里的四大考察模块2.1 SQL数据提取从能查到会查SQL在数据分析笔试中基本是送分题但也是拉开差距的题。网易这份卷子里的SQL题不复杂表面上就是几个表的关联查询、聚合统计但仔细看会发现它埋了“陷阱”。比如常见的一道题给定用户表、订单表、商品表求每个用户最近一单的购买金额。看起来很简单找出每个用户的最大下单时间再关联订单表求金额。但如果你直接写成GROUP BY user_id加MAX(order_time)是不够的因为“最近一单”不仅需要时间最大还需要拿到那一整行的金额。这时候就需要用窗口函数先按用户分区分组按时间排序用ROW_NUMBER()标号再筛选排序号为1的记录。这类题考察的不只是SQL语法熟练度而是你有没有真正理解“先排序再取数”的逻辑。很多候选人能把窗口函数的语法写出来但不知道什么时候该用这就说明平时练习不够。实操层面我建议准备笔试时重点练三类SQL场景分组聚合与条件聚合SUM(CASE WHEN ...)这类写法要熟练业务里做留存率、转化率分析天天用。窗口函数ROW_NUMBER()、RANK()、DENSE_RANK()、LAG()、LEAD()这些是排名、同环比计算的利器。多表关联的细节控制INNER JOIN、LEFT JOIN的区别关联键是否有重复值这在实际业务里最容易出错。注意窗口函数是笔试高频考点。很多同学觉得 SQL 很简单结果一上手写窗口函数就卡壳。平时多用实际数据练手不要只看书。2.2 概率与统计量化思维的基本功网易笔试里有一道我印象深刻的概率题一个游戏内有A、B两种道具玩家每日登录有概率获得道具问连续登录若干天两种道具都至少获得一次的概率。这道题用容斥原理做很简单先算总概率减去只拿到一种道具的概率再加上一种都没拿到的概率。但考场上很多人会纠结半天原因不是不会公式而是没有快速识别的能力。这种“识别题型”的能力是统计笔试的核心。我当时准备时给自己定了个规则读完题先判断它属于哪一类概率模型——古典概型、几何分布、二项分布、泊松分布、正态分布还是贝叶斯公式。分清类别后再套工具效率会高很多。统计部分也一样。假设检验几乎是数据分析笔试的必考点网易也不例外。有一道题目是给出一组实验数据问新功能是否显著提升了用户时长。表面上看就是算p值判断显著性但实际操作时要考虑样本量够不够方差是否齐性用的是什么检验方法我在面试中遇到过不少候选人张口就是“p值小于0.05就显著”但问他p值是什么含义说不清楚。这其实是基本功不扎实的信号。理解p值的本质是“在原假设为真的情况下观察到当前或更极端结果的概率”比背结论重要得多。实操心得在复习假设检验时我推荐用“三步法”第一步明确原假设和备择假设第二步根据数据类型选检验方法第三步根据p值下结论并评估业务意义。这套流程在笔试和面试里都非常实用。2.3 业务案例分析从数据到洞察的跳跃数据分析和数据工程师最大的区别就在于是否具备业务洞察力。网易这份卷子自然少不了业务案例分析。题目通常会给一个场景比如“网易云音乐的推荐点击率下降了5%请分析可能的原因”。这种题没有标准答案考察的是你的分析框架。我当时回答的框架是先确认数据口径排除数据质量问题拆维度按渠道、用户群、版本、时间维度分别看点击率变化定位异常用“维度下钻对比分析”的方法找到最显著的异常维度提出假设结合业务经验分析是推荐算法变化、内容供给减少还是外部竞争拉低用户活跃给出验证方案下一步怎么用数据验证假设。这个框架的本质就是“假设驱动数据验证”。笔试时一定要表现出你有结构化拆解问题的能力而不是东一榔头西一棒子。后来我在实际工作中做增长分析用的也是这套思路。分析一个指标下降了先别急着下结论把数据拆碎了看找到最异常的维度再结合业务深挖原因。2.4 Python编程与工具应用基本功不能丢虽然职位叫“数据分析工程师”但笔试里Python的题目并不是特别难通常是一些数据处理和算法题。比如用pandas读取数据、做分组聚合、处理缺失值或者是用Python实现一个简单的算法如斐波那契数列、字符串反转。说白了Python题考察的是编程基本功和数据处理库的熟练度。我当时复习的时候坚持每天手写几道pandas的操作merge、groupby、apply、pivot_table确保这些高频操作不用查文档也能写出来。笔试是有时间限制的写代码的速度和准确率同样重要。我记得笔试卷上有一道题让从给定的用户行为日志中计算每日活跃用户数。直接写就是df.groupby(date)[user_id].nunique()但如果你平时没用过nunique()可能会先drop_duplicates()再count()多写好几行代码。这种细节上的熟练度在笔试里就是时间优势。重要提醒笔试的Python题目要注意缩进和变量命名规范。我见过很多答卷因为一个缩进错误导致运行报错白白丢分。平时用IDE写代码时自动格式化习惯了手写代码时就容易忽略这些细节。3. 实操过程与核心环节实现从题目到方案的完整推导3.1 一道典型SQL题的完整拆解我们拿一道典型题目来完整走一遍流程。题目是给定订单表和用户表统计每个月份的新客数和老客数。拿到题先不要急着写代码先明确业务定义。“新客”指的是在这个月才第一次下单的用户“老客”指的是之前已经下过单的用户。那么核心逻辑就是先找出每个用户的首次下单月份再判断每个用户在某月的下单记录中是否属于首次下单。具体写法可以分两步第一步用窗口函数找出每个用户的首次下单月份SELECT user_id, DATE_TRUNC(month, MIN(order_time)) AS first_month FROM orders GROUP BY user_id第二步把原表和首次下单月份关联判断是新客还是老客SELECT DATE_TRUNC(month, a.order_time) AS order_month, IF(DATE_TRUNC(month, a.order_time) b.first_month, new, old) AS user_type, COUNT(DISTINCT a.user_id) AS user_cnt FROM orders a LEFT JOIN ( SELECT user_id, DATE_TRUNC(month, MIN(order_time)) AS first_month FROM orders GROUP BY user_id ) b ON a.user_id b.user_id GROUP BY order_month, user_type这个案例看起来简单但在实际业务中会衍生出很多变体。比如按周统计、按渠道维度拆分、计算用户生命周期价值等。掌握“先定义清楚口径再写代码”的思路比背代码重要得多。在笔试中写清楚注释和思路也有加分效果因为面试官能通过你的解题过程判断你的分析习惯。3.2 一道统计推断题的完整推导再看一道典型的统计推断题某功能改版后抽样了1000个用户发现平均使用时长从10分钟提升到10.5分钟样本标准差为5分钟。问改版是否有效第一步建立假设原假设H0为“改版前后使用时长无显著差异”备择假设H1为“改版后使用时长显著提升”。第二步计算检验统计量。由于样本量较大n1000根据中心极限定理样本均值的抽样分布近似正态。标准误为标准差/根号n 5/√1000 ≈ 0.158。检验统计量z (10.5 - 10) / 0.158 ≈ 3.16。第三步查标准正态分布表p值约等于0.0008远小于0.05。因此在95%置信水平下拒绝原假设认为改版有效。这道题完整走下来核心不是让你记住z值公式而是理解“样本均值的波动性”和“差异的统计显著性”之间的关系。我在实际工作中看过不少分析报告只看平均值的提升就下结论说“效果显著”完全没有考虑波动和样本量这种报告说服力很差。笔试里考察这些其实是提前给候选人敲响警钟数据分析不是看数字大小做判断而是用统计思维做判断。实操心得笔试和面试中如果时间允许务必把“结论依据业务含义”三层结构写清楚。只写“p0.05”是拿不到高分的要说明这个统计结论在业务上意味着什么比如“功能有效但用户时长的绝对提升量只有0.5分钟业务价值有限建议结合留存、付费等指标综合评估”。3.3 业务案例题的答题结构从思路到卷面呈现业务案例题考察的不仅是思维还有表达。我当时形成了一套稳定的答题模板直到现在做分析报告还在用明确问题把模糊的业务问题转化为清晰的数据问题明确核心指标和口径分析框架用逻辑树拆解可能的原因确保覆盖全面且不重叠数据验证说明需要哪些数据、用什么方法验证每个假设建议与落地根据分析结果给出可执行的业务建议并说明预期效果。这套模板的最大价值是强迫你先想清楚再动笔避免“想到哪写到哪”。笔试阅卷时间有限结构清晰的卷面天然占便宜。面试官看到这种答卷第一反应就是这个候选人有做分析师的潜质因为他在用结构化的方式工作。我给一个参考模板大家可以根据题目自行调整针对“推荐点击率下降5%”这个问题我会按照以下步骤进行分析。首先明确点击率的计算口径检查数据埋点和ETL流程是否异常排除数据质量问题。其次从渠道维度看是新增渠道点击率低拉低了整体还是所有渠道同步下降从用户群维度看是新用户还是老用户下降更明显从时间维度看是持续下降还是脉冲式下跌。再次基于拆解结果提出假设如果是新用户点击率下降幅度最大可能原因包括新用户推荐策略调整、冷启动模型失效、推荐内容供给变化等。最后用分层对比和回归分析验证假设并将结论转化成产品优化建议。这段话不仅适用于笔试也适用于面试回答甚至可以直接迁移到工作汇报中。3.4 时间分配与得分策略笔试的时间管理也是一个实操要点。普遍的时间分配策略是SQL题和Python题占50%的时间统计题占25%业务案例题占25%。理由是SQL和Python是相对确定的知识点会就是会拿到了就是分值业务案例题比较开放写多写少很难量化性价比相对不稳定。我当时给自己定的策略是先把有确定性答案的题全部做完做完再回头对付开放题。这个策略帮助我在时间紧张的情况下至少保住了基础分。我还见过一些同学因为一道SQL题卡壳太长时间导致后面大数据量的Python题没时间做这是最亏的。笔试不是做学术研究在有限时间内拿到尽可能多的分数才是目标。4. 常见问题与排错技巧实录笔试踩坑与避坑指南4.1 高频错误一SQL关联时没有注意一对多关系这是一个极易踩的坑。笔试里经常有一道题统计用户表里每个用户对应的订单总数。如果需要关联用户表和订单表直接用LEFT JOIN关联后COUNT往往会出现用户订单数翻倍的情况。原因是订单表里的用户ID有重复关联后一个用户对应多行数据导致计数错误。解决方法是如果只是统计订单数可以不用关联用户表直接GROUP BY订单表如果一定要关联需要用COUNT(DISTINCT order_id)避免重复计数。这种细节不仅是笔试考点在实际业务中也很常见。我从工作第一年起就养成了一个习惯凡是涉及多表关联后的计数一定检查是否有重复键。4.2 高频错误二对p值的误解假设检验里最常见的错误就是把p值理解为“原假设成立的概率”。这是统计学里被误解最多的概念之一。我在笔试阅卷时经常看到这种表述“p值小于0.05说明原假设只有5%的概率发生因此拒绝原假设”。这句话严格来说是不严谨的。正确的理解是p值是在原假设为真的前提下观察到当前样本及更极端结果的概率。如果是做AB实验“p0.05”说明“如果改版没有效果那么观察到当前这么大差异的概率不超过5%”。因为概率很小所以反过来推断改版大概率有效。笔试时能把这个逻辑说清楚已经超过大部分候选人。4.3 高频错误三案例分析流于表面没有数据支撑业务案例题最常见的答题问题是提出了一堆猜测“可能原因A、可能原因B、可能原因C”但没有说明每个原因怎么验证。面试官看完只会觉得你思维发散但没有分析深度。改进方法是每个假设后都跟上“数据验证方案”。比如你说“可能是渠道投放质量下降”后面跟上“需要按渠道拆分点击率、转化率对比投放消耗和素材点击率的变化趋势”。这样就有了一套完整的“假设-验证”闭环而不是空对空。4.4 备考建议与学习路线如果从零开始准备数据分析笔试我的建议是把复习分为三个阶段每阶段任务清晰按部就班执行第一阶段基础夯实约1-2周掌握SQL基础语法和常用函数理解概率统计核心概念。推荐把《SQL必知必会》快速过一遍概率统计复习随机变量、概率分布、假设检验、回归分析等章节。每天保持一定的刷题量。第二阶段专项突破约1-2周针对高频考点做专项训练。重点是窗口函数、留存率计算、假设检验应用题、业务案例分析。这一阶段要把“思路-代码-结论”完整写出来不要只写个大概。第三阶段模拟冲刺约1周按照笔试卷的时间和题型分布做整套模拟题。严格控制时间模拟真实考试节奏。做完后对错题进行归因分析是知识点缺失、粗心大意还是时间分配不合理。这种复盘比多刷一套题更有价值。重要提醒很多备考者只关注刷题数量忽视了错题复盘。我备考时最有效的环节就是每天花30分钟整理当天错题的原因和解题思路这样坚持下来“坑”会越攒越少正确率才能真正提升。5. 从笔试到实战的延伸思考这份卷子教给我什么5.1 数据敏感性是长期积累的工作几年后再回看这份卷子我发现它考察的核心能力——数据敏感性是没办法临时抱佛脚的。数据敏感性体现在你看到“点击率下降5%”时第一反应是“先别慌看看是不是数据口径变了”体现在你做AB实验时第一反应是“样本量够不够”体现在你看一份报表时第一反应是“这个数据有没有可能是错的”。这种敏感性只能靠平时多看数据、多想原因、多验证假设来积累。笔试只是用一个场景来测试你的这个积累。所以我现在带新人的时候第一课不是教工具而是教他们用“怀疑一切”的心态看数据先确认数据的合理性和口径再开始分析。这个习惯能帮你避开30%以上的低级错误。5.2 分析工具是手段业务解决是目的网易18年的卷子里SQL题和Python题考察的是“手段”业务案例题考察的才是“目的”。很多人备考时容易本末倒置疯狂刷技术题结果到案例分析环节不知道如何下笔。我的建议是工具刷题保持熟练度就够了真正拉开差距的是你对业务的理解和拆解能力。多看看行业分析报告多思考产品为什么要做这个功能多追问数据背后的业务含义。这些功夫花在平时你分析问题的深度会明显提升。我在面试候选人时更喜欢问业务案例而不是手写代码就是因为后者可以通过短期冲刺准备而前者反映真实积累。5.3 结合当前技术趋势看笔试变化虽然这份卷子出自2018年但数据分析岗位的笔试逻辑没有本质变化只是在技术工具上有所演进。现在的一些笔试和面试会考察更复杂的分析场景比如基于用户行为日志做漏斗分析、用Python批量处理多表数据、利用数据可视化工具快速输出分析报告。一些团队也会关注候选人是否了解自动化数据分析工具比如用Dify做数据清洗的流程自动化、用DBeaver做数据库管理和可视化等。这些虽然不是传统笔试的重点但反映了行业对效率越来越高的要求。我的看法是新工具值得关注但不要盲目追新。笔试的核心永远是基本功——SQL、统计、业务思维。工具只是服务于这些基本功的高效载体。你只要把数据分析的底层逻辑吃透了工具上手都不难反过来只会点工具而不懂分析逻辑很难建立真正的核心竞争力。6. 常见问题速查表与实战技巧总结为了便于大家对照自查我把笔记中遇到的问题和解决方案整理成一个速查表方便笔试复习时快速翻阅。问题场景高频错误正确做法SQL多表关联计数一个用户对应多行导致翻倍关注关联键是否唯一必要时使用COUNT(DISTINCT)窗口函数取最近记录用GROUP BY取最大时间后拿不到整行用ROW_NUMBER()排序后筛选排名第一假设检验p值p值理解为“原假设成立的概率”理解为原假设为真时出现当前样本结果的概率业务案例分析列出一堆原因但没有验证方法每个假设都配套数据验证方案Python数据处理忘记处理缺失值和重复值数据清洗的步骤要完整保持代码规范分析结论只看数值不看波动和样本量结合置信区间和业务意义综合判断关于笔试技巧还有几点补充写字要清晰代码要注意缩进步骤分也是分遇到不会的题先跳过做完全部会做的再回头啃业务案例题没有标准答案关键是展示思考框架的完整性最后留出5分钟检查重点看SQL里的关联条件和统计题的计算符号。这几点都是我用实际教训换来的。有一场面试我因为SQL题关联键没注意重复值直接刷掉了后来复盘才发现这个低级错误。吃一堑长一智现在每次写完SQL我都会先在草稿纸上把表的关系画出来再写代码尽量避免类似问题。7. 最后再说几句实在话这份网易2018年的笔试卷从技术栈上看确实不是最新的但在能力考察的深度上并不落伍。它提醒我们一个事实数据分析师的核心竞争力不是最新版本的工具或框架而是“业务理解-数据提取-量化分析-业务落地”这个完整闭环的熟练度。工具会换届思维框架不会。对我个人来说从当年刷这份卷子备考到后来面试别人出题再到自己带团队做分析项目这个闭环一直贯穿始终。如果你正在准备校招笔试建议不要只盯着“2018”这个年份而是把它当成一份高质量的能力体检表逐项自查SQL能不能熟练写窗口函数假设检验能不能讲清楚p值的含义面对一个模糊的业务问题能不能快速搭出分析框架如果这三项都过关了你的准备已经超过大多数候选人。我始终相信笔试只是一个信号灯真正的数据分析能力是在一次又一次真实业务问题的解决中磨出来的。希望你通过拆解这份试卷不只是学会“解题”更能理解“分析师”这个角色到底承担什么样的责任。搞清楚这一点比多刷十套题更有价值。