跳转至

LZ-组6 用户行为分析与 Plus 平台项目终版报告(v1)

摘要

本项目围绕电商用户行为数据,完成了从原始数据接入、数据清洗、指标计算、用户与商品分析、关联推荐、可视化看板到服务器部署的完整流程。项目接入 9 个原始数据分片,共 100,150,807 条用户行为记录;经过统一规则处理后形成 100,095,182 条清洗数据,并扩展为 27 字段的统一分析数据。基于该数据,项目生成 25 个分析主题,形成 plus-release_006 发布版本,并通过 MySQL、Streamlit 和 Metabase 提供查询与展示。

项目完成了任务书规定的清洗、指标、看板、推荐、复盘和运营建议,同时进一步实现了完整数据处理、可恢复运行、结果一致性检查、版本管理、服务器部署和 Windows 工具化等增强成果。

1. 项目背景与目标

原始数据记录了用户在 2017-11-25 至 2017-12-03 期间对商品的浏览、收藏、加购和购买行为。任务书要求团队围绕数据质量、核心指标、可视化、推荐和运营复盘形成完整交付。

团队在完成基础要求的同时,进一步设定四个增强目标:

  1. 不只处理样本,而是处理 9 个分片中的一亿级完整数据;
  2. 建立统一字段、指标和主题,避免成员之间数字不一致;
  3. 将分析结果部署到数据库和线上看板,而不只提交静态文件;
  4. 将处理经验整理为可重复运行、可检查、可继续完善的 Windows 数据流水线。

2. 团队分工与协作

团队采用“组长总控、领域主责、看板共建、交叉检查、统一发布”的协作方式。

成员 正式角色 主要工作 Metabase 主责
黎钊恺 项目经理、总体设计与关键技术负责人 需求拆解、总体架构、Plus 12、27 字段、25 主题、Plus 13、服务器部署、版本管理和最终整合 答辩总览、数据与方法
吴锐锋 数据处理与质量检查负责人 清洗说明、数据质量、控制数字、指标口径和一致性复核 流量与转化
康奕 可视化与展示负责人 图表选择、页面布局、标题单位、截图、看板说明和展示统一 类目与商品
贾天宇 推荐与用户运营分析负责人 关联推荐、用户机会、商品机会、运营建议和模拟经营解释 用户与机会、模拟经营结构

四名成员共同参与 Metabase 页面制作,并完成数据检查、视觉检查、业务解释检查和最终版本检查。组长负责跨模块统一和最终发布,其他成员对主责板块进行独立讲解并检查他人成果。

3. 数据来源与处理结果

3.1 原始数据

原始文件由 9 个 CSV 分片组成,每行包含:

  • 用户 ID;
  • 商品 ID;
  • 原始类目 ID;
  • 行为类型 pv/fav/cart/buy
  • Unix 时间戳。

3.2 正式控制数字

项目 结果
原始行为记录 100,150,807 条
清洗后行为记录 100,095,182 条
未进入最终统一分析的记录 55,625 条
清洗后用户 987,991 人
清洗后商品 4,161,138 个
原始类目 9,437 类
浏览行为 89,660,671 次
收藏行为 2,888,258 次
加购行为 5,530,446 次
购买行为 2,015,807 次

buy 表示购买行为事件。由于原始数据没有独立订单号、订单状态和订单明细,本报告不把它直接称为真实订单。

3.3 数据处理流程

9 个原始分片
→ 文件识别与输入检查
→ 数据格式、时间和行为规则检查
→ 清洗并保留问题记录
→ 扩展为 27 字段
→ 生成 25 个分析主题
→ 数量、字段和结果一致性检查
→ plus-release_006
→ MySQL、Streamlit、Metabase

当前 Plus 正式成果由 12_自适应Windows数据流水线 直接生产。13_Plus企业后台 负责接收正式成果、生成发布版本、导入数据库并提供线上展示。v4.1 是较早的稳定基础版本,不是当前正式数据的直接生产者。

4. 27 字段统一分析数据

27 个字段分为四类:

  • 5 个原始字段:用户、商品、原始类目、行为、时间戳;
  • 8 个按明确规则计算的字段:标准时间、日期、小时、星期、周末、时段等;
  • 5 个人工映射字段:一级和二级业务分类等;
  • 9 个按固定规则生成的模拟字段:会话渠道、设备、地区、商品价格、折扣、模拟订单和金额等。

模拟字段使用固定规则生成,同样的输入会得到同样的结果,便于重复验证和展示完整经营分析方法。但模拟金额、订单、渠道、设备和地区不代表真实企业经营数据,相关结果只能用于教学和方法演示。

5. 分析体系与平台成果

5.1 25 个分析主题

主题覆盖以下六个方向:

  • 数据概况与时间分析;
  • 原始类目、映射类目和商品分析;
  • 会话、渠道和设备分析;
  • 用户画像、用户分层和地区分析;
  • 严格行为路径、意向未购和转化时间分析;
  • 模拟订单、金额、价格带和折扣结构分析。

5.2 发布与展示

正式展示版本为 plus-release_006

  • MySQL 发布 24 个固定查询入口,共 25,067 行汇总结果;
  • 大型主题明细继续使用 Parquet 和 DuckDB,只读查询;
  • Streamlit 提供综合概览、流量与转化、类目商品与用户、订单与经营结构、数据与方法五个标签页;
  • Metabase 按答辩总览、流量与转化、类目与商品、用户与机会、模拟经营结构、数据与方法六个板块组织;
  • 线上 Plus 与原 v4.1 并行运行,避免最终增强成果影响早期稳定版本。

6. 主要分析发现

6.1 峰值日期的流量增长快于购买行为增长

2017-12-02 的浏览量为 12,329,641,购买行为为 257,903,均为观察期高点。相对前 7 日平均,浏览量高 32.59%,购买行为高 20.34%。

这说明峰值期虽然带来更多行为,但购买行为增幅低于浏览增幅。运营复盘不能只看流量,还需要同时检查转化效率。由于数据没有活动和广告标签,本项目不直接认定高峰由某一活动造成。

6.2 晚间规模和效率较高,意向行为存在延迟转化

晚间浏览量为 36,912,077,购买行为为 728,562;晚间浏览后购买用户比例为 11.37%,早晨为 6.01%。严格浏览到购买转化率为 1.4163%,加购到购买率为 6.1202%,收藏到购买率为 4.2640%。

加购后 2—24 小时完成购买占 36.03%,超过 24 小时占 40.64%,合计约 76.67%。这表明许多用户并非即时完成购买,可将晚间和加购后的不同时间段作为触达实验候选。

6.3 商品行为高度集中,长尾商品需要分层处理

A 层商品 513,641 个,占商品总数 12.34%,贡献 80% 浏览和 77.22% 购买行为。商品注意力明显集中于少量头部商品,长尾商品数量大但单品行为较少。

项目识别 15,000 个需要进一步检查的商品,其中:

  • 低曝光但高转化 9,415 个;
  • 高曝光但没有浏览后购买 4,140 个;
  • 高意向但没有购买 1,445 个。

这些结果是候选清单,不是确定问题。正式规则同时排除 3,751,508 个数据量不足商品,最终可靠筛选 13,871 个商品,约占全部商品 0.33%,以降低小样本误判。

6.4 用户机会规模较大,但观察期限制必须说明

购买用户 672,404 人,占 68.06%;意向未购用户 256,012 人,占 25.91%;仅浏览用户 59,575 人,占 6.03%。另有 266,856 名高活跃未购买用户,占 27.01%。高活跃未购买属于另一种筛选口径,可能与其他人群交叉,不能直接相加。

观察期结束后用户是否购买未知,因此不能把意向未购或高活跃未购买直接称为永久流失。更合适的做法是补充更长观察窗口,再设计召回和转化实验。

6.5 模拟经营分析展示了方法,不代表真实财务结果

模拟经营主题可以展示金额、客单价、价格带、渠道、设备和地区的分析方式。例如模拟金额结构受高价带和家电、数码映射类目影响。但这些字段不是原始业务系统采集的数据,不能用于真实预算、收入或区域经营判断。

7. 关联推荐与机会应用

项目基于浏览、收藏、加购和购买等隐式反馈,形成商品之间的行为关联和推荐候选。推荐结果用于缩小检查范围,并通过具体商品抽查判断同类目或跨类目关系是否合理。

推荐结果不能直接证明一个商品导致另一个商品被购买,也不能保证上线后提升销量。正式应用需要结合商品可售状态、库存、价格、页面质量和投放来源,并通过对照实验验证点击、加购和购买行为的变化。

8. 运营优化方向

8.1 峰值期转化检查

  • 对 12 月 2 日按小时、类目、会话和来源进一步拆分;
  • 在晚间测试内容更新或触达;
  • 同时观察浏览、加购、购买行为和严格转化率;
  • 没有外部活动数据前,不下活动因果结论。

8.2 意向用户分层触达

  • 将加购未购、收藏未购、高活跃未购买分开管理;
  • 分别测试 24 小时内提醒和 24 小时后提醒;
  • 使用对照组判断是否带来增量,而不是只看触达后购买人数。

8.3 商品分层运营

  • 保障 A 层商品稳定曝光和页面质量;
  • 对低曝光高转化候选做小流量扩展测试;
  • 对高曝光无浏览后购买候选优先检查商品页、价格、库存和流量匹配;
  • 对数据量不足商品继续观察,不轻易下结论。

9. 工程化与版本演进

项目经历以下主要阶段:

  1. 早期 Python 清洗、样本指标、静态看板和推荐方向验证;
  2. v4.1 稳定基础版本;
  3. Plus 12 完整数据流水线,生成 27 字段、25 主题和质量检查结果;
  4. Plus 13 企业后台,形成 plus-release_006、MySQL、Streamlit、Metabase 和服务器展示;
  5. Windows 数据流水线工具版,将处理和质量检查经验整理为便于复用的桌面工具。

早期版本用于说明迭代过程,最终数据和分析结论统一使用 Plus 正式版本。

10. 项目验证

正式 run_001 已完成以下检查:

  • 输入、清洗和排除数量守恒;
  • 完整数据与清洗数据均为 27 字段;
  • 25 个主题表全部生成;
  • 关键维表主键违规为 0;
  • 按日期、类目、商品、会话、用户和价格带汇总的行为总数均与 100,095,182 条清洗数据一致;
  • 正式登记的 143 个文件逐个完成存在性、大小和 SHA-256 检查;
  • plus-release_006 独立验证通过;
  • 本地与服务器 Streamlit、MySQL 和 Metabase 查询完成验收。

11. 限制与后续工作

  • 数据仅覆盖 9 天,不适合推断长期趋势和季节规律;
  • buy 是购买行为事件,不等于真实订单;
  • 一级、二级业务分类来自人工映射,不等于平台真实类目体系;
  • 金额、订单、渠道、设备和地区属于固定规则模拟字段;
  • 机会商品、机会用户和推荐结果均需要进一步验证;
  • Windows 工具版正式提交前需形成固定快照,并保证 README、演示口径和实际文件一致;
  • 真实业务应用需要接入更长时间范围、订单、价格、库存、活动、渠道和成本数据。

12. 总结

本项目从任务书规定的基础分析出发,形成了完整的数据处理、分析、推荐、展示和部署成果。项目的核心价值不仅是产生若干图表,而是建立了统一的数据与指标基础,使一亿级行为数据能够被重复处理、可靠检查并通过不同工具稳定展示。

最终成果清楚区分了观测事实、计算结果、人工映射、模拟经营字段、分析推断和运营建议。团队通过领域分工、看板共建和交叉检查完成项目,既保留了负责人在总体架构和关键工程上的主要贡献,也体现了成员在数据质量、可视化、推荐和业务解释中的具体协作。