尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

网易校招数据分析师笔试复盘:SQL、业务分析与备考路线

网易校招数据分析师笔试复盘:SQL、业务分析与备考路线 2020年秋天我拿着准备了近一个月的简历投了网易校招的“数据分析师正式批”。当时心态其实很复杂网易互联网的笔试筛人率一直不低特别是数据分析师这种岗位既要考代码又要考业务还夹杂统计学和概率论想在两个小时里做完并且拿高分光靠临时抱佛脚根本不够。我后来完整复盘了这场笔试把考点体系、题型思路和踩坑的地方全整理了一遍发现对后续面试和工作都很有帮助。这篇就写给同样在准备数据分析师笔试和面试题的同学结合网易那场正式批的题型聊聊到底该怎样系统备考以及真正的数据分析师学习路线应该怎么安排。1. 网易2020校招笔试到底考什么整体画像与能力模型1.1 笔试的定位不是选拔做题家是筛掉“不会用数据思考的人”网易的校招笔试一般是在牛客网或自研系统里在线完成有摄像头监控限定时间全程不能离开页面。正式批相比提前批题库会更标准流程也规范很多但难度没有降低。我印象里试卷分成几块选择题、SQL题、Python/算法题、案例分析题整体时间非常紧如果你在某个选择题上纠结超过三分钟后面的综合题大概率会写不完。很多人把这场笔试当成普通的编程题考试这是最大的误区。网易数据分析师笔试的侧重点从来不是考察你会不会写循环、会不会排序而是考察你拿到一堆真实业务数据后能不能用数据思维去定义问题、拆解指标、给出可落地的方案。换句话说它想筛掉的是“只会调包跑模型”的人留下的是“能理解业务语言”的人。从岗位描述里就能看出来网易数据分析师要跟产品、运营、游戏策划打交道要能回答“为什么留存下降了”“这个功能改版后效果到底好不好”“用户分层怎么做才能提升付费转化”这类问题。所以笔试里出现业务分析题、AB实验设计题就不会奇怪了。1.2 从真题分布看网易对数据分析师的期待我把印象里的题型和大致占比整理成了表格便于你对照自己的短板去补模块大致占比主要考察方向SQL题20% - 25%窗口函数、join、留存计算、累计计算统计学15%假设检验、p值、置信区间、概率基础Python/算法15% - 20%pandas处理、简单算法、逻辑思维业务分析与案例分析30% - 35%指标拆解、问题诊断、AB实验、决策建议概率计算与数学题10%贝叶斯、期望、随机变量分布从这个分布能明显感觉到业务分析占比最高SQL是硬通货统计学和Python则属于基本功。国内很多应届生备考时容易陷入“刷LeetCode算法题”的误区其实网易更希望你是个“懂业务的工程师”而不是“纯程序员”。这种题目设计背后的逻辑是知名公司校招笔试要在短短两小时内快速判断候选人能不能融入团队。SQL是基础工具但业务分析能看出候选人的思维深度。你肯不肯拆解问题、有没有用户视角、能不能在短时间内输出结构化结论这些才是拉开差距的地方。2. 真题经验复盘我印象最深的五类题型2.1 SQL必考窗口函数以“次日留存率”为例SQL题几乎每年都会考留存、漏斗、排行榜这类问题。我那场印象最深的是一道“计算每日新增用户次日留存率”的题目。表结构很简单login(user_id, login_date)。具体要求是先找到每个用户首登日期也就是新增日期然后计算这批新增用户在第二天仍然登录的人数比例。分享一下我当时的写法select a.first_date as login_date, count(distinct a.user_id) as new_user_cnt, count(distinct b.user_id) as retention_user_cnt, count(distinct b.user_id) / count(distinct a.user_id) as retention_rate from ( select user_id, min(date(login_date)) as first_date from login group by user_id ) a left join login b on a.user_id b.user_id and datediff(date(b.login_date), a.first_date) 1 group by a.first_date这里的关键有两点。第一用min(date(login_date))从登录表里找出每个用户的首登日期这一步处理了“用户可能一天登录多次”的脏数据。第二left join的时候不仅关联user_id还要加一个datediff1的条件这样才能保证只统计次日活跃而不是把用户的全部登录行为都算进来。我当时还犯过一个错误第一版只关联了user_id忘了限制日期差结果留存率全部变成100%。这个问题在笔试里非常典型因为系统只会告诉你“答案错误”不会告诉你错在哪儿。所以写SQL的时候一定要先想清楚业务口径再动手。窗口函数也是必考重点。比如row_number()、rank()、dense_rank()的区别网易常会出一道“统计各品类销量前三的商品”类似题目。这类题目用rank还是dense_rank要看业务要求一般来说“前三名”如果允许并列用dense_rank更合适。2.2 统计学假设检验为什么p值不是万能的统计题没考太多复杂公式但考察了大量假设检验的基础概念。比如给了两个版本的转化率样本问差异是否显著p值小于0.05说明什么选项里会混入一些常见误解“说明A组比B组好95%”“说明原假设成立概率小于5%”。正确答案应该是在原假设为真的前提下观测到当前或更极端结果的概率小于5%。这类题目看似简单却特别能筛人因为很多人在学校背过公式却完全没有理解p值的业务含义。网易还挺喜欢考“第一类错误”和“第二类错误”比如提升样本量会如何影响两类错误。样本量增大通常会让检验的把握度更高也就是减小第二类错误但对显著性水平也就是第一类错误是需要人为设定的不是自动变小。统计学备考不要死记公式要理解每个概念背后的决策场景。假设检验本质上是在做决策我们是用数据去否定“两版本没有差异”这个原假设。p值只是辅助决策的证据强度不是结论本身。面试时考官如果追问你“那p等于0.051怎么办”你至少要知道不能简单说“不显著”而是要结合样本量、效应量、业务成本综合判断。2.3 业务分析题网易云音乐的改版评估怎么答案例分析题是笔试的大头我抽到的场景是“云音乐某核心页面改版后次周活跃用户数下降了8%请分析可能原因并给出验证思路”。这种题没有标准答案但判分看重的是你的思路是否完整。我当时按照“先验证数据可靠性再拆指标再横向找维度最后给行动建议”的结构来答先排除数据问题确认统计口径是否变化比如改版前后版本号、埋点有没有差异、上报日志是否丢失。把“次周活跃用户数”这个整体指标拆解成新用户活跃、老用户活跃再按访问来源拆成自然访问、推送访问、外部渠道访问。继续往下钻取看是哪些端、哪些用户群在下降比如安卓还是iOS老用户还是新用户高活还是低活。结合功能变化看是否某个入口被折叠、提醒关闭、推荐算法调整导致用户访问路径断了。最后给出验证方式比如对比关停开关用户、查看漏斗流失环节、做小流量还原实验。业务分析题的本质是“结构化”。你不能上来就说“可能是推荐算法出了问题”那只是猜。面试官希望看到你用漏斗分析、维度拆解、假设验证这样的方法去逼近答案。平时准备数据分析师面试题的时候一定要养成用“假设驱动数据验证”方式思考的习惯。2.4 AB实验设计不止是开流量、看显著性AB实验题也是网易笔试的重头戏。有一道题大概是“某功能要全量上线你在设计AB实验时需要考虑哪些因素”。很多人只写了“要设置对照组和实验组”“样本量要足够”“跑两周看显著性”这能拿基础分但拿不了高分。高分回答要覆盖这些细节分流单位是用户ID还是设备ID如果用户多端登录是否会导致同一个用户同时进入实验组和对照组。实验组和对照组是否满足正交性均匀分流后要用AA实验检验两组本身有没有显著差异。样本量估算要基于基线转化率和最小可检测提升不要跑完才发现显著性算不出。实验周期要覆盖完整业务周期至少一个自然周最好包含周末和工作日。要预防新奇效应和破坏性效应功能刚上线的好奇心理会让短期内数据虚高运行一段时间后回落。关注长期指标和护栏指标比如改版后短期留存涨了但人均听歌时长或会员付费转化是否下跌。网易的题经常把AB实验和业务分析揉在一起比如“实验组点击率显著提升但收入没有提升怎么判断是否上线”。这时候要从用户行为角度想可能是点击率提升但转化率下降或者点击被分散到低价值场景。最终决策要结合核心业务目标不是守着p值。2.5 Python算法题常见小陷阱笔试里的Python部分不像互联网大厂算法岗那样考hard题更多是考察基础语法、逻辑思维、以及用pandas处理数据的能力。我记得有一些选择题会问Python可变对象传参、列表切片、匿名函数这类基础知识比如下面这种def func(x, arr[]): arr.append(x) return arr print(func(1)) print(func(2, [])) print(func(3))如果你不知道默认参数在函数定义时只执行一次你一定会答错。第二个调用传了新的空列表第三个调用又会复用第一次定义时那个arr所以结果是[1]、[2]、[1,3]。这种题很阴险但不算超纲工作里遇到默认参数确实是坑。pandas题目则非常实用会给你一个DataFrame要求筛选重复记录、按列聚合、填充缺失值、处理时间序列。网易数据团队日常肯定大量使用pandas所以你至少要熟悉groupby、merge、apply、fillna、drop_duplicates这些基础操作。复习时不要只看书在电脑上敲一遍比背接口强十倍。3. 数据分析师学习路线从笔试倒推20天怎么准备3.1 基础阶段SQL和统计学要占六成时间如果你时间非常紧比如只剩20天准备笔试我建议把学习路线切成三段而不是一上来就刷真题。前十天重点补SQL和统计学因为这两块是笔试里最容易通过短期训练提分的。SQL只要熟练掌握基础查询、聚合、多表连接、子查询、窗口函数再配合牛客网在线练习基本能覆盖80%考题。统计学的重点是描述统计、概率分布、假设检验、置信区间、相关性和回归基础。我的经验是不要试图去背所有概率公式要理解它们在业务场景里的含义。统计学里有一个非常重要的知识点是“辛普森悖论”网易笔试选择题中曾出现类似案例整体看A转化率高但分层看每个用户群都是B转化率高。这个点放在业务题里也经常考因为它特别容易在实际数据分析中踩坑面试官很爱看你是不是有这种“警惕混淆变量”的意识。3.2 刷题阶段用好牛客网和LeetCode刷题不用贪多但要有针对性。牛客网上有大量历年校招真题里面关于数据分析师的题库非常适合用来模拟。我当时的策略是每两天刷一套题重点不是做对而是总结每道题背后的考察点。LeetCode数据库题可以刷中等难度的SQL题尤其是“连续登录天数”“部门工资前三高”这类问题做两遍你会明显感觉到窗口函数的肌肉记忆被训练出来。Python部分每天抽半小时做简单算法题像排序、二分、字符串处理目的是保持手感而不是去拼最优解。刷题过程中要给自己定时。网易正式批的笔试时间很紧如果你每道SQL题都要想20分钟那肯定不行。建议每道SQL控制在10分钟内业务分析题控制在25分钟内留出时间检查。3.3 业务sense阶段用“故事法”训练分析思路业务sense是笔试里最难临时抱佛脚的部分。但也不是完全没办法。我当时用了一个比较笨但有效的方法找几个互联网产品比如网易云音乐、网易严选、有道词典每两天挑一个业务指标自己给自己出题。比如“严选的加购率下降了怎么办”我会先定义加购率的口径再拆指标维度再列出可能的验证方案。这个练习不是为了压中原题而是为了让脑子形成“遇到问题先拆解”的肌肉记忆。面试和笔试最怕的不是不懂业务而是脑子一片空白。只要你形成了一套稳定的分析框架就算遇到没见过的业务场景也能往里套。这个方法我称之为“故事法”给每个指标编一个完整的业务故事从数据采集到报表呈现再到问题诊断讲通了才算掌握。4. CDA数据分析师证书和笔试备考的关系我踩过的选择坑4.1 证书能加分吗很多准备入行数据分析师的同学会纠结要不要考CDA数据分析师证书。我考过也和当时的面试官聊过这个话题。结论是对于校招笔试证书本身不会直接加分但备考CDA过程中搭建的知识框架确实能帮你更系统地准备笔试和面试题。CDA认证的内容覆盖了数据分析流程、数据采集、数据清洗、统计方法、数据可视化、业务报告等这部分和网易笔试的基础考察方向重合度很高。尤其是统计学和业务分析模块CDA教材里的案例能帮你补齐不少薄弱点。但我不建议在校招季花大量时间专门去考证。如果你的时间预算有限优先刷题和做项目CDA可以放拿offer以后再说。证书只是简历上的一个信息点面试官更看重的是你的实际动手能力和项目经历。4.2 怎样备考才不浪费时间如果你还是想考CDA我最实用的建议是不要只看教材一定要配套刷题和做课程练习。CDA考试有很多概念题比如数据挖掘流程、抽样方法、图表选择这些理解之后并不难但需要反复记忆。我当时利用每天睡前半小时看CDA的统计学和数据分析框架白天刷牛客题等于把认证备考和校招备考结合起来。你会发现知识是互通的比如CDA里的数据质量评估在笔试中就是“验证埋点是否正确”的分析思路。有一点需要注意如果简历上写了CDA证书面试官可能会追问一些细碎概念比如“数据质量包含哪些维度”“你用什么方法处理缺失值”。这些内容不能只背答案要能举出实际例子。哪怕例子是从项目里或者网上的案例中看来的也比干巴巴背书好。5. 笔试后的面试题延伸一面和二面到底在问什么5.1 项目描述要带上业务结果笔试通过后面试官手里会有你的笔试成绩和简历。数据分析师面试题绕不开项目经历。很多候选人在自我介绍时会说“我做过一个用户流失预测模型用XGBoost准确率85%”。听上去挺厉害但面试官问第一句就露馅了准确率85%是在什么数据集上得到的正负样本比例多少你用了哪些特征你做的这个模型解决了什么业务问题正确讲项目的方式是结构化描述项目背景、我的角色、数据口径、分析方法、落地效果。不要说“我负责建模”要说清楚这个模型上线后转化率提升了多少、给业务方提供了什么可执行的结论。哪怕项目只是课程设计或者比赛只要你能讲出思考过程和业务价值也会很有竞争力。网易比较看重数据分析师能不能把分析结论推动到业务落地。所以面试回答里一定不要只停在“我发现了一个现象”要继续讲“我建议做某件事然后评估效果”。5.2 高频面试题指标波动、辛普森悖论、用户分层我整理了一些面试中大概率会碰到的问题你可以提前准备如果核心指标某天突然下跌5%你如何排查对应的是“业务分析思维”可以先确认数据质量再拆时间、地区、版本、渠道再做相关性分析。如何判断两个指标是否存在因果关系对应“相关不等于因果”要设计实验或使用因果推断方法。怎么做用户分层对应“RFM模型、分位数、K-Means聚类”的落地场景以及分层后怎么匹配不同运营策略。什么是辛普森悖论请举例说明。对应“分组与整体结论相反”的情况常见于渠道转化率分析。如果给你一个产品让你设计一套指标体系你会怎么设计对应“OSM模型、AARRR模型”要能结合产品特性说清楚。这些问题没有标准答案但回答的核心逻辑是“先问清楚业务目标再拆解指标再给方案”。我见过很多候选人一上来就报各种分析模型其实面试官想听到的是你如何把业务问题转换为数据问题再转换为可执行的方案。6. 最容易丢分的细节我的五大避坑指南6.1 时间分配笔试2小时的倒计时陷阱我考网易正式批的时候一开始做选择题太犹豫导致后面业务分析题只能匆匆写几句话。后来复盘发现选择题每道分值不高花费太多时间性价比极低。建议按分值分配时间SQL和业务题是大头要留出至少60%的时间选择题不会的可以标记后跳过不要恋战。系统一般有分题跳转功能先把会的做完再回头想难题。6.2 题目读一半就开始写答案业务分析题经常会有很长的题干包括业务背景、数据表结构、问题目标。我那时候因为着急看到“指标下降”就开始写原因结果忽略了题干里明确写了“改版后新增了X功能”导致回答方向偏了。笔试中的每一个条件都不是多余的出题人经常把关键线索藏在细节里。建议读题两遍再动手磨刀不误砍柴工。6.3 忽略数据的生成逻辑有一道SQL题给了一张订单表里面有order_id、user_id、paid_time题目要求计算复购率。很多人直接count(distinct user_id)做条件判断但没有考虑“一个用户一天内下了多单”算不算复购。如果口径上没有明确你需要先说明自己的假设或者用“去重后的自然日/用户”来定义复购。在真实业务里统计口径错了结果完全不可比笔试中这种地方往往就是扣分点。6.4 SQL写出来就跑不检查逻辑在线编译器不会告诉你“你的逻辑对了一半”。我那次写完SQL后以为自己全对其实漏了一种情况新增用户的次日登录可能发生在当天也就是跨时区问题。系统记录的是UTC时间业务上需要切换成北京时间日期边界没处理结果就会少算一部分用户。排查这类问题没有捷径只能在写完SQL后回到数据中检查几个用户样例验证join条件是否按预期匹配。6.5 以为自己懂AB实验却忽略了一堆前提业务题里问AB实验注意事项时你能写出“对照组和实验组各50%”并不等于懂AB实验。网易很可能会追问“实验组和对照组样本量不一致行不行”“同一用户在多端登录会不会影响实验准确性”“实验期遇到大促怎么办”。这些细节没有标准模板你要理解每个实验设计决策背后的统计原理和业务影响。回顾整个过程我最大的体会是网易这场正式批笔试考的不是你“会不会做题”而是你“有没有数据分析师的工作习惯”。从SQL口径到业务拆解从统计推断到实验评估每一个环节都在模拟真实工作场景。准备数据分析师面试题的时候多问自己“这个结论能直接给业务方看吗”比单纯刷题更有用。希望这篇复盘能让你少走一些弯路真正把每一道题的价值榨干。
返回列表