扩展维度规范
目标
后续如果希望从更多维度分析用户行为,应在不破坏已有展示工具的前提下扩展数据结构。
扩展原则
- 原有字段不随意改名。
- 新维度优先新增字段。
- 当新维度导致表过宽或粒度明显变化时,新增一张汇总表。
- 每个新增维度必须有字段说明和口径说明。
- Streamlit 和 Metabase 都读取同一套标准汇总数据。
- 新增维度前先登记业务问题、指标编号、数据粒度和预期图表。
- 用户数、转化率等不可加指标不能从多个单维表临时拼接。
- 组合筛选必须有对应组合粒度表,或由 DuckDB 查询清洗后的 Parquet。
可扩展维度
| 维度 | 推荐字段 | 说明 |
|---|---|---|
| 大类映射 | mapped_major_category |
来自附加题分类标识对照表或映射规则 |
| 二级分类 | mapped_sub_category |
来自附加题分类标识对照表或映射规则 |
| 价格带 | price_band |
仅用于明确标注的模拟扩展 |
| 用户价值 | user_value_segment |
基于购买行为和活跃度;无金额时称 RF,不称 RFM |
| 行为路径 | path_type |
如 pv->cart->buy |
| 时间阶段 | period_stage |
如预热期、高峰期、回落期 |
| 地区 | region |
仅在允许使用虚拟扩展字段时使用,不进入主结论 |
| 渠道 | channel |
仅在允许使用虚拟扩展字段时使用,不进入主结论 |
新增字段方式
适合轻量扩展,例如在 category_metrics.csv 增加:
mapped_major_category
mapped_sub_category
要求:
- 原字段保持不变。
- 新字段追加在表尾。
- 字段说明同步更新。
- Streamlit 可选择读取新字段;旧页面不依赖新字段。
新增汇总表方式
适合新增分析主题,例如:
path_metrics.csv
cohort_retention_metrics.csv
rfm_segment.csv
category_mapping_metrics.csv
daily_category_metrics.csv
daily_segment_metrics.csv
每张新表必须说明:
- 分析问题
- 粒度
- 主键或唯一组合
- 字段说明
- 与已有表的关系
- 支持哪些组合筛选,以及哪些筛选不支持
Metabase 扩展
Metabase 中新增维度时:
- 优先导入新汇总表。
- 给字段设置显示名和类型。
- 建立常用筛选器,例如日期、类目、用户分层。
- 仪表盘图表标题要对应业务问题。
Streamlit 扩展
Streamlit 中新增维度时:
- 在侧边栏增加筛选器。
- 不让页面一次性读取原始明细。
- 对大表先聚合再展示。
- 保留默认视图,避免新字段缺失时页面报错。
静态 HTML 扩展
静态 HTML 新增维度时:
- 优先生成单独页面或模块。
- 不把大量明细数据内嵌到 HTML。
- 保留截图,便于 PPT 和答辩备用。