跳转至

业务问题驱动分析框架

1. 文档定位

本文是项目分析、数据交付、看板、报告和答辩的上位规范。任务书规定的清洗、指标、看板、推荐和复盘构成基础闭环;留存、路径、RF、长尾和异常分析作为可插拔专题接入同一条证据链。

项目不以“做了多少张图”为完成标准,而以“是否形成可复核、可解释、可行动的结论”为完成标准。

2. 统一证据链

每个分析主题必须按以下顺序组织:

业务问题 -> 分析假设 -> 指标口径 -> 分析维度 -> 数据粒度
        -> 汇总表 -> 图表 -> 数据发现 -> 业务解释
        -> 运营动作 -> 收益测算 -> 后续验证

禁止先制作图表再为图表寻找结论。无法说明业务问题、数据来源或指标口径的图表不进入正式看板、报告和 PPT。

3. 四层架构

层级 职责 主要产出
数据可信层 证明数据能被正确读取、清洗和复算 清洗脚本、质量报告、版本记录
指标语义层 统一指标、粒度、过滤条件和适用边界 指标字典、主题汇总表、校验结果
分析诊断层 回答发生了什么、为什么以及影响在哪里 基础分析、增强专题、证据链卡片
决策展示层 将结论转为运营动作并完成展示 看板、复盘报告、收益情景、PPT

展示层不得重新定义指标。报告、看板和 PPT 必须引用同一版本的指标语义层。

4. 分析主题登记

每个主题在“分析主题总表”中登记一行,至少包含:

字段 填写要求
analysis_id 稳定编号,如 A-CONV-01
business_question 用问句描述要解决的问题
hypothesis 可被数据支持或否定的假设
metric_ids 引用指标字典中的编号
dimensions 日期、小时、类目、用户层级等
grain 一行数据代表什么
source_table 使用的标准汇总表
chart 图表形式及其回答的问题
finding 只填写已经计算验证的发现
action 与发现直接对应的运营动作
impact_formula 情景收益公式,不虚构真实收益
limitation 数据或方法边界
owner/status/version 负责人、状态和数据版本

主题状态统一为:待定义待计算待复核已验证已发布已废弃

5. 分析优先级和进入门禁

P0:基础闭环

  • 数据质量与清洗前后对比。
  • 流量、趋势和时段峰谷。
  • 用户数与行为次数双口径转化。
  • 购买频次分层与复购。
  • 类目排行、转化和动销。
  • 商品关联推荐。
  • 三个业务问题的诊断、建议和收益情景。

P1:高价值增强

  • 同一用户、同一商品、满足时间顺序的行为路径。
  • RF 用户价值分层。
  • 首购、跨日复购、跨商品复购。
  • D1/D3 等可比观察窗口留存。
  • 类目四象限、集中度、长尾和曝光无成交。
  • 浏览到购买、加购到购买耗时。
  • 异常高频行为候选。

P2:冲刺专题

  • 行为序列转移概率。
  • 推荐覆盖率、流行度偏差和同类目率。
  • 不同指标定义下的敏感性分析。

P3:模拟扩展

虚拟价格、地区、渠道和 GMV 只允许放在明确标注的模拟附录,不进入真实数据主结论和主看板。

新增主题进入正式交付前必须同时满足:口径已登记、数据可复算、结果已复核、图表有业务问题、结论未越过数据边界。

6. 关键口径边界

  • favcart 是并行意向行为,不默认构成严格的连续漏斗。
  • 独立用户行为人数形成的是“行为渗透漏斗”;严格路径转化必须验证行为顺序。
  • buy 是购买行为记录,不等同于订单;没有订单号时不使用订单量、客单价等表述。
  • 复购至少区分多次购买行为、跨日购买和跨商品购买三种口径。
  • UV 不可跨日直接求和;全周期 UV 必须基于全周期用户去重。
  • 时间戳统一按 Asia/Shanghai 转换。
  • 9 天数据存在观察窗口截断,留存和生命周期结论只代表样本期。
  • 末位分类映射属于附加题的人为映射,不与真实 category_id 结论混用。

7. 数据流和组合筛选

原始 CSV(不可修改)
  -> 清洗明细/Parquet(统一时区、字段和异常策略)
  -> 主题汇总表(固定粒度、稳定字段)
  -> 指标复核(范围、总量、抽样和跨表一致性)
  -> Streamlit / Metabase / HTML
  -> 报告 / PPT / 演示视频

daily_metricscategory_metrics 等单维汇总表不能支持任意联合筛选。需要“日期 + 类目”等筛选时,应新增 daily_category_metrics 等固定粒度表,或由 DuckDB 查询清洗后的 Parquet。不得让筛选器只改变标题而不改变指标计算范围。

8. 异常处理与降级

  • 输入表缺失:页面显示缺失文件和要求字段,不使用模拟数字替代。
  • 指标分母为 0:结果留空并说明,不默认解释为 0% 表现。
  • 指标口径变更:升级指标版本,并同步更新汇总表、看板、报告和 PPT。
  • 数据范围固定为全部 9 个正式分片,dataset_scope = all_9_parts。单分片只允许用于开发测试,不得进入正式指标和结论。
  • 线上展示故障:保留本地 HTML、截图和汇总表作为答辩降级方案。

9. 验收与测试

每个发布版本至少完成:

  1. 字段和类型检查。
  2. 日期范围、时区和行为枚举检查。
  3. 数量非负、比率在合理范围内检查。
  4. 全周期指标与分组指标的可解释性检查。
  5. 用户数口径和行为次数口径标签检查。
  6. 看板筛选前后数字与源表抽查。
  7. 报告、看板和 PPT 关键数字一致性检查。
  8. 结论、建议和收益公式的一一对应检查。

10. 交付原则

  • 基础闭环完整后再发布增强专题。
  • 每个增强专题只增加一组明确的问题、数据表和结论,不复制整套基础指标。
  • 主报告承载证据链,PPT 只展示关键发现和行动,操作手册负责复现步骤。
  • 所有情景收益使用“若指标提升 X,则预计新增 Y”的表述,并明确 X 是假设而不是已实现结果。