数据分析完整流程实战:数据集选择、收集整理、标注、清洗到分析
用电商用户行为项目走一遍完整流程数据集选择 → 收集整理 → 数据标注 → 数据清洗 → 漏斗与 RFM 分析。工具为 pandas seaborn。一、数据集选择选数据集的标准业务链路完整、字段有公开字典。常见候选对比数据集规模优点缺点REES46 eCommerce behaviorKaggle2.85 亿事件真实数据view→cart→purchase 完整漏斗单文件 5GB需分块读取UCI Online Retail54 万行体量小只有交易流水无浏览行为Olist 巴西电商10 万订单多表结构缺成交前行为数据本文选用 REES46 的eCommerce behavior data from multi category storeMichael KechinovCC BY 4.0Kaggle / 天池可下载每行一个真实用户事件漏斗全链路完整。二、数据收集与整理分块读取大文件。2019-Oct.csv 约 4200 万行直接read_csv会超内存import pandas as pd cols [event_time, event_type, product_id, price, user_id, user_session] chunks pd.read_csv(2019-Oct.csv, usecolscols, chunksize1_000_000) df pd.concat(chunks)统一粒度。原始数据一行一个事件漏斗分析需要一行一个用户透视转换user_df df.pivot_table(indexuser_id, columnsevent_type, valuesproduct_id, aggfunccount, fill_value0) user_df user_df.reset_index().rename_axis(columnsNone)整理后检查info()确认类型并将event_time转 datetimedescribe()抓异常统一列名。三、数据标注标注是把业务口径固化为代码标签分两类。1. 行为阶段标签。漏斗每步需明确定义且逐级嵌套点击发生有效浏览加购发生在点击之后下单、支付同理需做顺序校验。真实日志中常出现支付早于下单埋点延迟、跨天 session 拼接错误不校验会导致转化率超过 100%。2. 用户分层标签。以 RFM 为例pay[R] pd.qcut(pay[days_since_last], 4, labels[4, 3, 2, 1]).astype(int) pay[F] pd.qcut(pay[order_count].rank(methodfirst), 4, labels[1, 2, 3, 4]).astype(int) pay[M] pd.qcut(pay[amount].rank(methodfirst), 4, labels[1, 2, 3, 4]).astype(int) pay[RFM] pay[R] pay[F] pay[M]总分 ≥10 标高价值7~9潜力5~6一般≤4待唤醒。阈值需与业务方确认后固定不可每次调整。四、数据清洗本文数据含 150 条重复记录、300 个年龄缺失df df.drop_duplicates(subsetuser_id) # 按业务主键去重 df[age] df[age].fillna(df[age].median()) # 数值缺失填中位数原则去重按subset主键不整行比对数值缺失用中位数抗异常值类别缺失先判断缺失是否本身是一种状态如 brand 为空多为无牌商品标 unknown 比填众数合理删行前输出删除比例超过 5% 需先查原因REES46 原始数据中category_code缺失 1300 余万条、brand缺失 600 余万条处理方式是在品类/品牌分析时过滤而非整行删除。五、分析结果转化漏斗。整体曝光→支付转化率 14.2%环节转化率曝光 → 点击45.0%点击 → 加购59.2%加购 → 下单61.8%下单 → 支付86.2%最大流失在曝光→点击问题在流量质量与素材优化方向为投放定向和首图。渠道对比。短视频渠道支付转化 16.4%四个渠道最高社交裂变下单→支付转化 95%搜索广告各级均平庸。建议搜索广告预算向短视频倾斜社交裂变用于老带新激励。RFM 分层。高价值用户占 15.8%贡献 24.8% 营收整体客单价 236 元。运营动作高价值用户给专属权益待唤醒用户做召回 AB 实验中间层常规触达。常见问题FAQQ数据分析项目去哪里找数据集Kaggle、天池、UCI Machine Learning Repository。选择标准业务链路完整、字段有公开数据字典。REES46 电商行为数据2.85 亿真实事件CC BY 4.0适合漏斗与 RFM 分析UCI Online Retail 适合入门。Q数据标注在数据分析里指什么把业务口径固化为代码标签。包括行为阶段标注定义漏斗每步触发条件与先后顺序和用户分层标注如 RFM 四分位打分映射为高价值待唤醒。规则需与业务方对齐后固定。Q数据清洗的必须步骤按顺序按业务主键去重 → 处理缺失值数值用中位数类别标 unknown→ 校验逻辑矛盾如支付时间早于下单时间→ 处理异常值。每步删改前查看占比超过 5% 先查原因。QCSV 太大 pandas 读不动怎么办read_csv使用chunksize分块读取配合usecols只加载需要的列逐块聚合后合并。4200 万行数据普通笔记本即可处理。QRFM 模型代码怎么实现对付费用户按最近购买天数R、订单数F、消费金额M分别pd.qcut四分位打分后求和按阈值映射分层。F 和 M 打分前用rank(methodfirst)处理同分避免分箱失败。

相关新闻