标准汇总表字段规范
1. 通用规范
所有汇总表必须明确“一行代表什么”,并满足:
- 英文小写字段名,多词使用下划线。
- 日期为
YYYY-MM-DD,小时为0至23。 - 比率字段以
_rate结尾,保存为 0 至 1 的小数。 - 数量字段以
_count、_users或_items结尾。 - ID 字段优先按字符串读取,避免展示为科学计数法。
- 时间戳按
Asia/Shanghai转换。 - 分母为 0 时比率留空,不把未知结果伪装为 0%。
- 使用“购买行为次数”而不是“订单数”。
- 已发布字段保持向后兼容;需要更精确的口径时追加新字段,不直接改名。
每批数据同时提供 dataset_manifest.csv:
table_name,grain,primary_key,dataset_scope,date_start,date_end,
timezone,metric_version,data_version,generated_at,generated_by
正式发布时 dataset_scope 固定为 all_9_parts,generated_by 指向生成脚本。单分片测试文件不得上传展示层。
2. P0 基础汇总表
daily_metrics.csv
粒度:日期。主键:date。
date,pv_count,fav_count,cart_count,buy_count,
uv_count,buyer_count,pv_per_uv,buy_rate,
pv_users,fav_users,cart_users,buy_users,pv_per_pv_user,
pv_to_cart_user_rate,pv_to_buy_user_rate
兼容字段中,uv_count 表示当日发生任意行为的用户,buyer_count 与 buy_users 口径相同,buy_rate = buyer_count / uv_count。新增的浏览转化指标使用 pv_users 作为分母。全周期用户数不得通过每日用户数求和获得。
hourly_metrics.csv
粒度:日期 × 小时。主键:date + hour。
date,hour,pv_count,fav_count,cart_count,buy_count,
uv_count,pv_users,fav_users,cart_users,buy_users
category_metrics.csv
粒度:全观察期 × 原始类目。主键:category_id。
category_id,pv_count,fav_count,cart_count,buy_count,
uv_count,pv_users,buy_users,item_count,exposed_item_count,
sold_item_count,pv_to_buy_user_rate,sell_through_rate
item_count 保留原定义,表示发生任意行为的商品数;exposed_item_count 表示发生 pv 的商品数。动销率分母使用 exposed_item_count。
user_segment.csv
粒度:用户分层。主键:segment。
segment,segment_rule,user_count,pv_count,fav_count,cart_count,
buy_count,user_share,buy_share
推荐基础分层:non_buyer、single_day_buyer、repeat_day_buyer、high_frequency_buyer。分层规则不得只写在代码中。
funnel_metrics.csv
粒度:漏斗口径 × 阶段。主键:funnel_type + stage。
funnel_type,stage,stage_order,user_count,event_count,
previous_stage_rate,first_stage_rate,is_strict_sequence,note
funnel_type 至少区分:
behavior_penetration:发生过对应行为,不保证顺序。strict_user_item_path:同一用户和商品满足时间顺序。
recommend_sample.csv
粒度:主商品 × 推荐排名。主键:item_id + rank。
item_id,rank,recommend_item_id,co_occurrence_count,
same_category,category_id,recommend_category_id,method_version
data_quality_report.csv
粒度:文件或全局范围 × 检查项。
scope,check_item,input_count,issue_count,issue_rate,
handling_strategy,output_count,note
3. P1 组合筛选和增强汇总表
单独的日表和类目表不能正确支持“日期 + 类目”联合筛选。需要对应筛选时新增以下固定粒度表,或由 DuckDB 查询清洗后的 Parquet。
| 表 | 粒度 | 主要用途 |
|---|---|---|
daily_category_metrics.csv |
日期 × 类目 | 日期和类目联合趋势 |
daily_segment_metrics.csv |
日期 × 用户层级 | 用户层级趋势 |
path_metrics.csv |
路径 × 日期/类目 | 严格路径和转化耗时 |
cohort_retention_metrics.csv |
cohort 日期 × 留存天数 × 类型 | D1/D3 留存 |
rf_segment.csv |
RF 层级 | 用户价值分层 |
item_metrics.csv |
商品 | 长尾和曝光无成交 |
recommendation_evaluation.csv |
算法版本/评估切片 | 推荐覆盖和偏差 |
path_metrics.csv 推荐字段:
date,category_id,path_type,eligible_users,converted_users,
conversion_rate,median_duration_minutes,window_hours,path_rule
cohort_retention_metrics.csv 推荐字段:
cohort_date,day_number,retention_type,cohort_users,
retained_users,retention_rate,is_observable
尚未到达对应留存天数时,is_observable = 0,留存率留空。
item_metrics.csv 推荐字段:
item_id,category_id,pv_count,fav_count,cart_count,buy_count,
pv_users,buy_users,has_exposure,has_buy
4. 人为映射和模拟数据
- 附加题末位映射字段使用
mapped_major_category、mapped_sub_category。 - 不得用映射值覆盖原始
category_id。 - 虚拟价格、地区和渠道放入独立模拟表,文件名以
simulated_开头。 - 模拟表不参与主线指标、主看板 KPI 和真实运营结论。
5. 发布验收
- 主键或唯一组合无重复。
- 日期范围和时区明确,分片范围为
all_9_parts。 - 数量非负,比率在 0 至 1 之间。
dataset_manifest.csv可追溯到生成脚本和指标版本。- 报告、看板和 PPT 使用相同
data_version。