跳转至

数据清洗操作步骤

1. 检查文件

确认 数据/data 下存在:

UserBehavior_part_0.csv
...
UserBehavior_part_8.csv
电商分类标识对照表.xlsx

忽略 ._UserBehavior_part_*.csv._电商分类标识对照表.xlsx,这些通常是 macOS 元数据文件。

正式输入必须同时包含 part_0part_8。脚本可先对一个分片试运行,但最终必须批量处理 9 个分片。

2. 抽样读取

抽样读取每个正式 CSV 的前几行,确认:

  • 每行 5 列。
  • 没有表头。
  • 行为类型为 pv/fav/cart/buy
  • 时间戳能转换为日期。

3. 字段标准化

统一字段:

user_id
item_id
category_id
behavior_type
timestamp
datetime
date
hour

4. 异常检查

必须检查:

  • 字段列数异常。
  • 空值。
  • 行为类型异常。
  • 时间戳解析失败。
  • 时间戳超出观察期。
  • 完全重复行。

5. 清洗策略

推荐策略:

  • 字段列数异常:剔除并记录。
  • 关键字段为空:剔除并记录。
  • 行为类型异常:剔除并记录。
  • 时间戳超出观察期:剔除或单独标记,报告中写明。
  • 重复行:按完全重复行去重,并记录数量。

6. 输出结果

小文件可提交仓库,大文件走外链。

推荐至少输出:

  • 逐分片质量摘要和合并后数据质量检查表。
  • 清洗过程说明。
  • 清洗后汇总表。

7. 常见错误

  • 直接双击大 CSV。
  • 只完成单分片测试,没有重新运行全部 9 个分片。
  • 忘记说明时间范围过滤。
  • 清洗后数据没有版本号。