跳转至

数据处理层

作用

数据处理层负责把原始淘宝用户行为 CSV 分片转为可展示、可查询、可复核的汇总数据。

推荐技术

Python + DuckDB + Parquet

原则

  • 原始 CSV 不长期放在 VPS 上。
  • 服务器可用于复跑小规模或最终汇总任务。
  • 大规模清洗优先在本地或更大磁盘环境完成。
  • 展示工具只读取汇总层数据。

推荐分层

raw/        原始 CSV,不建议长期放服务器
clean/      清洗后的 Parquet
mart/       指标汇总表
exports/    给 HTML、Streamlit、Metabase 使用的 CSV/JSON

汇总表口径

至少准备:

  • daily_metrics:按日期的 PV、UV、buy、转化率
  • hourly_metrics:按日期和小时的行为统计
  • category_metrics:按类目的 PV、收藏、加购、购买
  • user_segment:按购买频次的用户分层
  • funnel_metrics:浏览、收藏、加购、购买漏斗
  • recommend_sample:商品 Top-5 关联推荐样例

与工具联动

  • Pyecharts 使用 exports/ 生成静态 HTML。
  • Streamlit 读取 mart/exports/
  • MySQL 导入 mart/ 中的汇总表,供 Metabase 使用。