跳转至

标准汇总表字段规范

1. 通用规范

所有汇总表必须明确“一行代表什么”,并满足:

  • 英文小写字段名,多词使用下划线。
  • 日期为 YYYY-MM-DD,小时为 023
  • 比率字段以 _rate 结尾,保存为 0 至 1 的小数。
  • 数量字段以 _count_users_items 结尾。
  • ID 字段优先按字符串读取,避免展示为科学计数法。
  • 时间戳按 Asia/Shanghai 转换。
  • 分母为 0 时比率留空,不把未知结果伪装为 0%。
  • 使用“购买行为次数”而不是“订单数”。
  • 已发布字段保持向后兼容;需要更精确的口径时追加新字段,不直接改名。

每批数据同时提供 dataset_manifest.csv

table_name,grain,primary_key,dataset_scope,date_start,date_end,
timezone,metric_version,data_version,generated_at,generated_by

正式发布时 dataset_scope 固定为 all_9_partsgenerated_by 指向生成脚本。单分片测试文件不得上传展示层。

2. P0 基础汇总表

daily_metrics.csv

粒度:日期。主键:date

date,pv_count,fav_count,cart_count,buy_count,
uv_count,buyer_count,pv_per_uv,buy_rate,
pv_users,fav_users,cart_users,buy_users,pv_per_pv_user,
pv_to_cart_user_rate,pv_to_buy_user_rate

兼容字段中,uv_count 表示当日发生任意行为的用户,buyer_countbuy_users 口径相同,buy_rate = buyer_count / uv_count。新增的浏览转化指标使用 pv_users 作为分母。全周期用户数不得通过每日用户数求和获得。

hourly_metrics.csv

粒度:日期 × 小时。主键:date + hour

date,hour,pv_count,fav_count,cart_count,buy_count,
uv_count,pv_users,fav_users,cart_users,buy_users

category_metrics.csv

粒度:全观察期 × 原始类目。主键:category_id

category_id,pv_count,fav_count,cart_count,buy_count,
uv_count,pv_users,buy_users,item_count,exposed_item_count,
sold_item_count,pv_to_buy_user_rate,sell_through_rate

item_count 保留原定义,表示发生任意行为的商品数;exposed_item_count 表示发生 pv 的商品数。动销率分母使用 exposed_item_count

user_segment.csv

粒度:用户分层。主键:segment

segment,segment_rule,user_count,pv_count,fav_count,cart_count,
buy_count,user_share,buy_share

推荐基础分层:non_buyersingle_day_buyerrepeat_day_buyerhigh_frequency_buyer。分层规则不得只写在代码中。

funnel_metrics.csv

粒度:漏斗口径 × 阶段。主键:funnel_type + stage

funnel_type,stage,stage_order,user_count,event_count,
previous_stage_rate,first_stage_rate,is_strict_sequence,note

funnel_type 至少区分:

  • behavior_penetration:发生过对应行为,不保证顺序。
  • strict_user_item_path:同一用户和商品满足时间顺序。

recommend_sample.csv

粒度:主商品 × 推荐排名。主键:item_id + rank

item_id,rank,recommend_item_id,co_occurrence_count,
same_category,category_id,recommend_category_id,method_version

data_quality_report.csv

粒度:文件或全局范围 × 检查项。

scope,check_item,input_count,issue_count,issue_rate,
handling_strategy,output_count,note

3. P1 组合筛选和增强汇总表

单独的日表和类目表不能正确支持“日期 + 类目”联合筛选。需要对应筛选时新增以下固定粒度表,或由 DuckDB 查询清洗后的 Parquet。

粒度 主要用途
daily_category_metrics.csv 日期 × 类目 日期和类目联合趋势
daily_segment_metrics.csv 日期 × 用户层级 用户层级趋势
path_metrics.csv 路径 × 日期/类目 严格路径和转化耗时
cohort_retention_metrics.csv cohort 日期 × 留存天数 × 类型 D1/D3 留存
rf_segment.csv RF 层级 用户价值分层
item_metrics.csv 商品 长尾和曝光无成交
recommendation_evaluation.csv 算法版本/评估切片 推荐覆盖和偏差

path_metrics.csv 推荐字段:

date,category_id,path_type,eligible_users,converted_users,
conversion_rate,median_duration_minutes,window_hours,path_rule

cohort_retention_metrics.csv 推荐字段:

cohort_date,day_number,retention_type,cohort_users,
retained_users,retention_rate,is_observable

尚未到达对应留存天数时,is_observable = 0,留存率留空。

item_metrics.csv 推荐字段:

item_id,category_id,pv_count,fav_count,cart_count,buy_count,
pv_users,buy_users,has_exposure,has_buy

4. 人为映射和模拟数据

  • 附加题末位映射字段使用 mapped_major_categorymapped_sub_category
  • 不得用映射值覆盖原始 category_id
  • 虚拟价格、地区和渠道放入独立模拟表,文件名以 simulated_ 开头。
  • 模拟表不参与主线指标、主看板 KPI 和真实运营结论。

5. 发布验收

  • 主键或唯一组合无重复。
  • 日期范围和时区明确,分片范围为 all_9_parts
  • 数量非负,比率在 0 至 1 之间。
  • dataset_manifest.csv 可追溯到生成脚本和指标版本。
  • 报告、看板和 PPT 使用相同 data_version