业务问题驱动分析框架
1. 文档定位
本文是项目分析、数据交付、看板、报告和答辩的上位规范。任务书规定的清洗、指标、看板、推荐和复盘构成基础闭环;留存、路径、RF、长尾和异常分析作为可插拔专题接入同一条证据链。
项目不以“做了多少张图”为完成标准,而以“是否形成可复核、可解释、可行动的结论”为完成标准。
2. 统一证据链
每个分析主题必须按以下顺序组织:
业务问题 -> 分析假设 -> 指标口径 -> 分析维度 -> 数据粒度
-> 汇总表 -> 图表 -> 数据发现 -> 业务解释
-> 运营动作 -> 收益测算 -> 后续验证
禁止先制作图表再为图表寻找结论。无法说明业务问题、数据来源或指标口径的图表不进入正式看板、报告和 PPT。
3. 四层架构
| 层级 | 职责 | 主要产出 |
|---|---|---|
| 数据可信层 | 证明数据能被正确读取、清洗和复算 | 清洗脚本、质量报告、版本记录 |
| 指标语义层 | 统一指标、粒度、过滤条件和适用边界 | 指标字典、主题汇总表、校验结果 |
| 分析诊断层 | 回答发生了什么、为什么以及影响在哪里 | 基础分析、增强专题、证据链卡片 |
| 决策展示层 | 将结论转为运营动作并完成展示 | 看板、复盘报告、收益情景、PPT |
展示层不得重新定义指标。报告、看板和 PPT 必须引用同一版本的指标语义层。
4. 分析主题登记
每个主题在“分析主题总表”中登记一行,至少包含:
| 字段 | 填写要求 |
|---|---|
analysis_id |
稳定编号,如 A-CONV-01 |
business_question |
用问句描述要解决的问题 |
hypothesis |
可被数据支持或否定的假设 |
metric_ids |
引用指标字典中的编号 |
dimensions |
日期、小时、类目、用户层级等 |
grain |
一行数据代表什么 |
source_table |
使用的标准汇总表 |
chart |
图表形式及其回答的问题 |
finding |
只填写已经计算验证的发现 |
action |
与发现直接对应的运营动作 |
impact_formula |
情景收益公式,不虚构真实收益 |
limitation |
数据或方法边界 |
owner/status/version |
负责人、状态和数据版本 |
主题状态统一为:待定义、待计算、待复核、已验证、已发布、已废弃。
5. 分析优先级和进入门禁
P0:基础闭环
- 数据质量与清洗前后对比。
- 流量、趋势和时段峰谷。
- 用户数与行为次数双口径转化。
- 购买频次分层与复购。
- 类目排行、转化和动销。
- 商品关联推荐。
- 三个业务问题的诊断、建议和收益情景。
P1:高价值增强
- 同一用户、同一商品、满足时间顺序的行为路径。
- RF 用户价值分层。
- 首购、跨日复购、跨商品复购。
- D1/D3 等可比观察窗口留存。
- 类目四象限、集中度、长尾和曝光无成交。
- 浏览到购买、加购到购买耗时。
- 异常高频行为候选。
P2:冲刺专题
- 行为序列转移概率。
- 推荐覆盖率、流行度偏差和同类目率。
- 不同指标定义下的敏感性分析。
P3:模拟扩展
虚拟价格、地区、渠道和 GMV 只允许放在明确标注的模拟附录,不进入真实数据主结论和主看板。
新增主题进入正式交付前必须同时满足:口径已登记、数据可复算、结果已复核、图表有业务问题、结论未越过数据边界。
6. 关键口径边界
fav和cart是并行意向行为,不默认构成严格的连续漏斗。- 独立用户行为人数形成的是“行为渗透漏斗”;严格路径转化必须验证行为顺序。
buy是购买行为记录,不等同于订单;没有订单号时不使用订单量、客单价等表述。- 复购至少区分多次购买行为、跨日购买和跨商品购买三种口径。
- UV 不可跨日直接求和;全周期 UV 必须基于全周期用户去重。
- 时间戳统一按
Asia/Shanghai转换。 - 9 天数据存在观察窗口截断,留存和生命周期结论只代表样本期。
- 末位分类映射属于附加题的人为映射,不与真实
category_id结论混用。
7. 数据流和组合筛选
原始 CSV(不可修改)
-> 清洗明细/Parquet(统一时区、字段和异常策略)
-> 主题汇总表(固定粒度、稳定字段)
-> 指标复核(范围、总量、抽样和跨表一致性)
-> Streamlit / Metabase / HTML
-> 报告 / PPT / 演示视频
daily_metrics、category_metrics 等单维汇总表不能支持任意联合筛选。需要“日期 + 类目”等筛选时,应新增 daily_category_metrics 等固定粒度表,或由 DuckDB 查询清洗后的 Parquet。不得让筛选器只改变标题而不改变指标计算范围。
8. 异常处理与降级
- 输入表缺失:页面显示缺失文件和要求字段,不使用模拟数字替代。
- 指标分母为 0:结果留空并说明,不默认解释为 0% 表现。
- 指标口径变更:升级指标版本,并同步更新汇总表、看板、报告和 PPT。
- 数据范围固定为全部 9 个正式分片,
dataset_scope = all_9_parts。单分片只允许用于开发测试,不得进入正式指标和结论。 - 线上展示故障:保留本地 HTML、截图和汇总表作为答辩降级方案。
9. 验收与测试
每个发布版本至少完成:
- 字段和类型检查。
- 日期范围、时区和行为枚举检查。
- 数量非负、比率在合理范围内检查。
- 全周期指标与分组指标的可解释性检查。
- 用户数口径和行为次数口径标签检查。
- 看板筛选前后数字与源表抽查。
- 报告、看板和 PPT 关键数字一致性检查。
- 结论、建议和收益公式的一一对应检查。
10. 交付原则
- 基础闭环完整后再发布增强专题。
- 每个增强专题只增加一组明确的问题、数据表和结论,不复制整套基础指标。
- 主报告承载证据链,PPT 只展示关键发现和行动,操作手册负责复现步骤。
- 所有情景收益使用“若指标提升 X,则预计新增 Y”的表述,并明确 X 是假设而不是已实现结果。