跳转至

数据清洗任务说明

1. 任务目标

把原始用户行为 CSV 数据整理成可分析、可复核的数据基础,并输出数据质量检查结果。

2. 输入材料

  • E:\实训\数据\data\UserBehavior_part_0.csvUserBehavior_part_8.csv
  • E:\实训\数据\data\电商分类标识对照表.xlsx
  • 任务书观察期:2017-11-25 至 2017-12-03

正式清洗范围为全部 9 个分片。允许先用一个分片验证脚本,但最终质量报告、清洗结果和指标输入必须覆盖 part_0part_8

3. 推荐工具

工具 推荐程度 用途
Python csv / pandas chunksize 推荐 分块读取大 CSV
DuckDB 可选增强 SQL 查询和聚合
Excel / WPS 只用于结果 查看质量检查表

4. 阶段小任务

阶段 小任务 最低产出 完成标准
1 文件体检 文件大小和数量记录 确认 9 个正式 CSV
2 抽样读取 前几行样本 确认 5 列无表头
3 字段命名 字段映射表 统一英文列名
4 异常检查 异常统计 行为类型、缺失、时间范围
5 清洗输出 清洗说明和质量表 可供指标计算使用

5. 输出文件

文件 位置 是否必须
清洗脚本 clean.py 代码/清洗/ 推荐
数据质量检查表 其他/数据质量检查/ 必须
清洗过程说明 文档/过程记录/ 必须
清洗后大文件外链 其他/外链登记/ 如有大文件则必须

6. 验收标准

  • 不把全部大 CSV 一次性载入内存,应使用 DuckDB、Parquet 或 pandas 分块处理。
  • 字段名统一为 user_id,item_id,category_id,behavior_type,timestamp
  • 能说明观察期外时间戳如何处理。
  • 能说明缺失、重复、异常行为类型检查结果。
  • 输出结果能支撑指标计算。

7. 给 AI 的执行提示词

请基于 E:\实训\数据\data 下的 UserBehavior_part_*.csv 设计数据清洗方案或脚本。
要求:正式结果必须覆盖 part_0 至 part_8 全部 9 个分片;不要把全部数据一次性载入内存;字段无表头,顺序为 user_id,item_id,category_id,behavior_type,timestamp;观察期为 2017-11-25 至 2017-12-03;检查缺失值、异常行为类型、时间范围异常、重复行;输出逐分片摘要、合并后质量报告和清洗过程说明。不要把原始大 CSV 写入仓库。