数据清洗任务说明
1. 任务目标
把原始用户行为 CSV 数据整理成可分析、可复核的数据基础,并输出数据质量检查结果。
2. 输入材料
E:\实训\数据\data\UserBehavior_part_0.csv 至 UserBehavior_part_8.csv
E:\实训\数据\data\电商分类标识对照表.xlsx
- 任务书观察期:2017-11-25 至 2017-12-03
正式清洗范围为全部 9 个分片。允许先用一个分片验证脚本,但最终质量报告、清洗结果和指标输入必须覆盖 part_0 至 part_8。
3. 推荐工具
| 工具 |
推荐程度 |
用途 |
| Python csv / pandas chunksize |
推荐 |
分块读取大 CSV |
| DuckDB |
可选增强 |
SQL 查询和聚合 |
| Excel / WPS |
只用于结果 |
查看质量检查表 |
4. 阶段小任务
| 阶段 |
小任务 |
最低产出 |
完成标准 |
| 1 |
文件体检 |
文件大小和数量记录 |
确认 9 个正式 CSV |
| 2 |
抽样读取 |
前几行样本 |
确认 5 列无表头 |
| 3 |
字段命名 |
字段映射表 |
统一英文列名 |
| 4 |
异常检查 |
异常统计 |
行为类型、缺失、时间范围 |
| 5 |
清洗输出 |
清洗说明和质量表 |
可供指标计算使用 |
5. 输出文件
| 文件 |
位置 |
是否必须 |
清洗脚本 clean.py |
代码/清洗/ |
推荐 |
| 数据质量检查表 |
其他/数据质量检查/ |
必须 |
| 清洗过程说明 |
文档/过程记录/ |
必须 |
| 清洗后大文件外链 |
其他/外链登记/ |
如有大文件则必须 |
6. 验收标准
- 不把全部大 CSV 一次性载入内存,应使用 DuckDB、Parquet 或 pandas 分块处理。
- 字段名统一为
user_id,item_id,category_id,behavior_type,timestamp。
- 能说明观察期外时间戳如何处理。
- 能说明缺失、重复、异常行为类型检查结果。
- 输出结果能支撑指标计算。
7. 给 AI 的执行提示词
请基于 E:\实训\数据\data 下的 UserBehavior_part_*.csv 设计数据清洗方案或脚本。
要求:正式结果必须覆盖 part_0 至 part_8 全部 9 个分片;不要把全部数据一次性载入内存;字段无表头,顺序为 user_id,item_id,category_id,behavior_type,timestamp;观察期为 2017-11-25 至 2017-12-03;检查缺失值、异常行为类型、时间范围异常、重复行;输出逐分片摘要、合并后质量报告和清洗过程说明。不要把原始大 CSV 写入仓库。