数据清洗操作步骤
1. 检查文件
确认 数据/data 下存在:
UserBehavior_part_0.csv
...
UserBehavior_part_8.csv
电商分类标识对照表.xlsx
忽略 ._UserBehavior_part_*.csv 和 ._电商分类标识对照表.xlsx,这些通常是 macOS 元数据文件。
正式输入必须同时包含 part_0 至 part_8。脚本可先对一个分片试运行,但最终必须批量处理 9 个分片。
2. 抽样读取
抽样读取每个正式 CSV 的前几行,确认:
- 每行 5 列。
- 没有表头。
- 行为类型为
pv/fav/cart/buy。 - 时间戳能转换为日期。
3. 字段标准化
统一字段:
user_id
item_id
category_id
behavior_type
timestamp
datetime
date
hour
4. 异常检查
必须检查:
- 字段列数异常。
- 空值。
- 行为类型异常。
- 时间戳解析失败。
- 时间戳超出观察期。
- 完全重复行。
5. 清洗策略
推荐策略:
- 字段列数异常:剔除并记录。
- 关键字段为空:剔除并记录。
- 行为类型异常:剔除并记录。
- 时间戳超出观察期:剔除或单独标记,报告中写明。
- 重复行:按完全重复行去重,并记录数量。
6. 输出结果
小文件可提交仓库,大文件走外链。
推荐至少输出:
- 逐分片质量摘要和合并后数据质量检查表。
- 清洗过程说明。
- 清洗后汇总表。
7. 常见错误
- 直接双击大 CSV。
- 只完成单分片测试,没有重新运行全部 9 个分片。
- 忘记说明时间范围过滤。
- 清洗后数据没有版本号。