LZ-组6 用户行为分析与 Plus 平台项目终版报告(v1)
摘要
本项目围绕电商用户行为数据,完成了从原始数据接入、数据清洗、指标计算、用户与商品分析、关联推荐、可视化看板到服务器部署的完整流程。项目接入 9 个原始数据分片,共 100,150,807 条用户行为记录;经过统一规则处理后形成 100,095,182 条清洗数据,并扩展为 27 字段的统一分析数据。基于该数据,项目生成 25 个分析主题,形成 plus-release_006 发布版本,并通过 MySQL、Streamlit 和 Metabase 提供查询与展示。
项目完成了任务书规定的清洗、指标、看板、推荐、复盘和运营建议,同时进一步实现了完整数据处理、可恢复运行、结果一致性检查、版本管理、服务器部署和 Windows 工具化等增强成果。
1. 项目背景与目标
原始数据记录了用户在 2017-11-25 至 2017-12-03 期间对商品的浏览、收藏、加购和购买行为。任务书要求团队围绕数据质量、核心指标、可视化、推荐和运营复盘形成完整交付。
团队在完成基础要求的同时,进一步设定四个增强目标:
- 不只处理样本,而是处理 9 个分片中的一亿级完整数据;
- 建立统一字段、指标和主题,避免成员之间数字不一致;
- 将分析结果部署到数据库和线上看板,而不只提交静态文件;
- 将处理经验整理为可重复运行、可检查、可继续完善的 Windows 数据流水线。
2. 团队分工与协作
团队采用“组长总控、领域主责、看板共建、交叉检查、统一发布”的协作方式。
| 成员 | 正式角色 | 主要工作 | Metabase 主责 |
|---|---|---|---|
| 黎钊恺 | 项目经理、总体设计与关键技术负责人 | 需求拆解、总体架构、Plus 12、27 字段、25 主题、Plus 13、服务器部署、版本管理和最终整合 | 答辩总览、数据与方法 |
| 吴锐锋 | 数据处理与质量检查负责人 | 清洗说明、数据质量、控制数字、指标口径和一致性复核 | 流量与转化 |
| 康奕 | 可视化与展示负责人 | 图表选择、页面布局、标题单位、截图、看板说明和展示统一 | 类目与商品 |
| 贾天宇 | 推荐与用户运营分析负责人 | 关联推荐、用户机会、商品机会、运营建议和模拟经营解释 | 用户与机会、模拟经营结构 |
四名成员共同参与 Metabase 页面制作,并完成数据检查、视觉检查、业务解释检查和最终版本检查。组长负责跨模块统一和最终发布,其他成员对主责板块进行独立讲解并检查他人成果。
3. 数据来源与处理结果
3.1 原始数据
原始文件由 9 个 CSV 分片组成,每行包含:
- 用户 ID;
- 商品 ID;
- 原始类目 ID;
- 行为类型
pv/fav/cart/buy; - Unix 时间戳。
3.2 正式控制数字
| 项目 | 结果 |
|---|---|
| 原始行为记录 | 100,150,807 条 |
| 清洗后行为记录 | 100,095,182 条 |
| 未进入最终统一分析的记录 | 55,625 条 |
| 清洗后用户 | 987,991 人 |
| 清洗后商品 | 4,161,138 个 |
| 原始类目 | 9,437 类 |
| 浏览行为 | 89,660,671 次 |
| 收藏行为 | 2,888,258 次 |
| 加购行为 | 5,530,446 次 |
| 购买行为 | 2,015,807 次 |
buy 表示购买行为事件。由于原始数据没有独立订单号、订单状态和订单明细,本报告不把它直接称为真实订单。
3.3 数据处理流程
9 个原始分片
→ 文件识别与输入检查
→ 数据格式、时间和行为规则检查
→ 清洗并保留问题记录
→ 扩展为 27 字段
→ 生成 25 个分析主题
→ 数量、字段和结果一致性检查
→ plus-release_006
→ MySQL、Streamlit、Metabase
当前 Plus 正式成果由 12_自适应Windows数据流水线 直接生产。13_Plus企业后台 负责接收正式成果、生成发布版本、导入数据库并提供线上展示。v4.1 是较早的稳定基础版本,不是当前正式数据的直接生产者。
4. 27 字段统一分析数据
27 个字段分为四类:
- 5 个原始字段:用户、商品、原始类目、行为、时间戳;
- 8 个按明确规则计算的字段:标准时间、日期、小时、星期、周末、时段等;
- 5 个人工映射字段:一级和二级业务分类等;
- 9 个按固定规则生成的模拟字段:会话渠道、设备、地区、商品价格、折扣、模拟订单和金额等。
模拟字段使用固定规则生成,同样的输入会得到同样的结果,便于重复验证和展示完整经营分析方法。但模拟金额、订单、渠道、设备和地区不代表真实企业经营数据,相关结果只能用于教学和方法演示。
5. 分析体系与平台成果
5.1 25 个分析主题
主题覆盖以下六个方向:
- 数据概况与时间分析;
- 原始类目、映射类目和商品分析;
- 会话、渠道和设备分析;
- 用户画像、用户分层和地区分析;
- 严格行为路径、意向未购和转化时间分析;
- 模拟订单、金额、价格带和折扣结构分析。
5.2 发布与展示
正式展示版本为 plus-release_006:
- MySQL 发布 24 个固定查询入口,共 25,067 行汇总结果;
- 大型主题明细继续使用 Parquet 和 DuckDB,只读查询;
- Streamlit 提供综合概览、流量与转化、类目商品与用户、订单与经营结构、数据与方法五个标签页;
- Metabase 按答辩总览、流量与转化、类目与商品、用户与机会、模拟经营结构、数据与方法六个板块组织;
- 线上 Plus 与原 v4.1 并行运行,避免最终增强成果影响早期稳定版本。
6. 主要分析发现
6.1 峰值日期的流量增长快于购买行为增长
2017-12-02 的浏览量为 12,329,641,购买行为为 257,903,均为观察期高点。相对前 7 日平均,浏览量高 32.59%,购买行为高 20.34%。
这说明峰值期虽然带来更多行为,但购买行为增幅低于浏览增幅。运营复盘不能只看流量,还需要同时检查转化效率。由于数据没有活动和广告标签,本项目不直接认定高峰由某一活动造成。
6.2 晚间规模和效率较高,意向行为存在延迟转化
晚间浏览量为 36,912,077,购买行为为 728,562;晚间浏览后购买用户比例为 11.37%,早晨为 6.01%。严格浏览到购买转化率为 1.4163%,加购到购买率为 6.1202%,收藏到购买率为 4.2640%。
加购后 2—24 小时完成购买占 36.03%,超过 24 小时占 40.64%,合计约 76.67%。这表明许多用户并非即时完成购买,可将晚间和加购后的不同时间段作为触达实验候选。
6.3 商品行为高度集中,长尾商品需要分层处理
A 层商品 513,641 个,占商品总数 12.34%,贡献 80% 浏览和 77.22% 购买行为。商品注意力明显集中于少量头部商品,长尾商品数量大但单品行为较少。
项目识别 15,000 个需要进一步检查的商品,其中:
- 低曝光但高转化 9,415 个;
- 高曝光但没有浏览后购买 4,140 个;
- 高意向但没有购买 1,445 个。
这些结果是候选清单,不是确定问题。正式规则同时排除 3,751,508 个数据量不足商品,最终可靠筛选 13,871 个商品,约占全部商品 0.33%,以降低小样本误判。
6.4 用户机会规模较大,但观察期限制必须说明
购买用户 672,404 人,占 68.06%;意向未购用户 256,012 人,占 25.91%;仅浏览用户 59,575 人,占 6.03%。另有 266,856 名高活跃未购买用户,占 27.01%。高活跃未购买属于另一种筛选口径,可能与其他人群交叉,不能直接相加。
观察期结束后用户是否购买未知,因此不能把意向未购或高活跃未购买直接称为永久流失。更合适的做法是补充更长观察窗口,再设计召回和转化实验。
6.5 模拟经营分析展示了方法,不代表真实财务结果
模拟经营主题可以展示金额、客单价、价格带、渠道、设备和地区的分析方式。例如模拟金额结构受高价带和家电、数码映射类目影响。但这些字段不是原始业务系统采集的数据,不能用于真实预算、收入或区域经营判断。
7. 关联推荐与机会应用
项目基于浏览、收藏、加购和购买等隐式反馈,形成商品之间的行为关联和推荐候选。推荐结果用于缩小检查范围,并通过具体商品抽查判断同类目或跨类目关系是否合理。
推荐结果不能直接证明一个商品导致另一个商品被购买,也不能保证上线后提升销量。正式应用需要结合商品可售状态、库存、价格、页面质量和投放来源,并通过对照实验验证点击、加购和购买行为的变化。
8. 运营优化方向
8.1 峰值期转化检查
- 对 12 月 2 日按小时、类目、会话和来源进一步拆分;
- 在晚间测试内容更新或触达;
- 同时观察浏览、加购、购买行为和严格转化率;
- 没有外部活动数据前,不下活动因果结论。
8.2 意向用户分层触达
- 将加购未购、收藏未购、高活跃未购买分开管理;
- 分别测试 24 小时内提醒和 24 小时后提醒;
- 使用对照组判断是否带来增量,而不是只看触达后购买人数。
8.3 商品分层运营
- 保障 A 层商品稳定曝光和页面质量;
- 对低曝光高转化候选做小流量扩展测试;
- 对高曝光无浏览后购买候选优先检查商品页、价格、库存和流量匹配;
- 对数据量不足商品继续观察,不轻易下结论。
9. 工程化与版本演进
项目经历以下主要阶段:
- 早期 Python 清洗、样本指标、静态看板和推荐方向验证;
- v4.1 稳定基础版本;
- Plus 12 完整数据流水线,生成 27 字段、25 主题和质量检查结果;
- Plus 13 企业后台,形成
plus-release_006、MySQL、Streamlit、Metabase 和服务器展示; - Windows 数据流水线工具版,将处理和质量检查经验整理为便于复用的桌面工具。
早期版本用于说明迭代过程,最终数据和分析结论统一使用 Plus 正式版本。
10. 项目验证
正式 run_001 已完成以下检查:
- 输入、清洗和排除数量守恒;
- 完整数据与清洗数据均为 27 字段;
- 25 个主题表全部生成;
- 关键维表主键违规为 0;
- 按日期、类目、商品、会话、用户和价格带汇总的行为总数均与 100,095,182 条清洗数据一致;
- 正式登记的 143 个文件逐个完成存在性、大小和 SHA-256 检查;
plus-release_006独立验证通过;- 本地与服务器 Streamlit、MySQL 和 Metabase 查询完成验收。
11. 限制与后续工作
- 数据仅覆盖 9 天,不适合推断长期趋势和季节规律;
buy是购买行为事件,不等于真实订单;- 一级、二级业务分类来自人工映射,不等于平台真实类目体系;
- 金额、订单、渠道、设备和地区属于固定规则模拟字段;
- 机会商品、机会用户和推荐结果均需要进一步验证;
- Windows 工具版正式提交前需形成固定快照,并保证 README、演示口径和实际文件一致;
- 真实业务应用需要接入更长时间范围、订单、价格、库存、活动、渠道和成本数据。
12. 总结
本项目从任务书规定的基础分析出发,形成了完整的数据处理、分析、推荐、展示和部署成果。项目的核心价值不仅是产生若干图表,而是建立了统一的数据与指标基础,使一亿级行为数据能够被重复处理、可靠检查并通过不同工具稳定展示。
最终成果清楚区分了观测事实、计算结果、人工映射、模拟经营字段、分析推断和运营建议。团队通过领域分工、看板共建和交叉检查完成项目,既保留了负责人在总体架构和关键工程上的主要贡献,也体现了成员在数据质量、可视化、推荐和业务解释中的具体协作。