答辩讲稿与追问回答
2分钟总讲稿
本项目基于 plus-release_006,分析了2017年11月25日至12月3日的100,095,182条清洗后行为记录,覆盖987,991名用户和4,161,138个商品。我们把结果发布为24个MySQL稳定视图,由Streamlit负责交互核查、Metabase负责独立BI展示。
行为趋势上,12月2日浏览量和购买行为达到观察期峰值,但浏览增幅高于购买增幅,因此不能只看流量。严格路径显示,加购到购买转化率为6.12%,并且约76.67%的加购后购买发生在2小时以后,说明延迟转化值得重点分析。
商品结构上,约12.34%的A层商品贡献80%的浏览;系统只把15,000个商品列为三类待核查候选,同时有约90.16%的商品因低样本被规则门禁排除。用户方面,仅意向用户约25.91%,高活跃未购买用户约27.01%,但所有意向未购买结果都受观察期右截尾影响,不能直接称为流失。
经营金额、订单、渠道、设备和地区均为模拟字段,只用于展示分析方法。我们的结论区分数据事实、解释推断和行动建议,最终建议通过更长观察期和对照实验验证,而不是直接把候选当成确定问题。
逐页讲解重点
答辩总览
先说明规模,再指向12月2日峰值、严格路径和商品候选。强调当前发布版本可追溯,候选尚未成为批准证据。
流量与转化
讲“什么时候活跃”和“如何转化”是两个问题。晚间规模和用户率较高;加购后购买存在明显延迟,应设计分时触达实验。
类目与商品
讲A层少量商品贡献大部分流量,同时C层数量巨大。候选规则用于形成核查队列,不直接代表商品好坏。
用户与机会
讲购买、仅意向、仅浏览三类状态;重点提醒右截尾,避免把观察期内未购买写成永久流失。
模拟经营结构
先说“以下均为模拟”。展示GMV、客单价、渠道等分析方法,不把数值当真实企业业绩。
数据与方法
展示24个稳定视图、发布版本、规则版本和低样本排除,回答“数据是否可信、结论如何追溯”。
常见追问
为什么buy不叫订单
原始行为数据中的buy是一条购买行为记录,没有真实订单号。一笔真实订单可能包含多条商品行为,因此只有模拟订单主题才能称为模拟订单。
为什么可以有GMV和客单价
这些字段来自统一模拟企业数据,用于演示经营分析结构。标题、字段和讲解都明确标注模拟,不用于声称真实收入。
为什么不用原始大表直接接Metabase
8个大型明细约3,765万行,更适合由DuckDB/Parquet按条件读取。Metabase只接25,067行的稳定汇总和服务主题,性能和口径更可控。
为什么转化率不直接用购买用户除浏览用户
正式指标使用浏览后购买用户交集作为分子,避免把没有发生浏览的购买用户错误计入浏览转化。
高活跃未购买是不是流失用户
不是。它只是观察期状态,而且意向主题全部右截尾。需要更长窗口确认后续是否购买。
候选商品能否直接下架或加投
不能。候选只提供核查排序,需要结合库存、可售状态、页面、价格、投放和实验结果确认。
为什么排除了大量商品
约90.16%的商品因低样本被排除。极小样本容易产生虚高转化或零转化假象,排除是可信度门禁,不是数据损失。
能否说明晚间触达一定更有效
不能。当前只观察到晚间规模和用户率较高,这是相关事实。是否由触达时段造成,需要随机实验验证。