先别急着否定试验假设,最该查的是“试验是否真的被执行到了目标对象上”。一个可操作的分界是:如果干预前后的原始记录、分流日志和生效时间都能对上,问题多半出在假设或指标;如果对不上,先修实施链路,再谈效果。
未发生预期变化,通常落在两种情形里。第一种是试验根本没按计划执行,比如配置没发布、脚本没加载、人群包为空。第二种是执行了,但只覆盖了一部分对象,比如只对新访客生效,而你看的是全部流量。两种情形的处理顺序完全不同。
判断依据不是看报表曲线,而是看实施证据。你需要能回答三个问题:改动在什么时间点生效?生效范围是谁?有多少对象实际命中了改动?如果这三个问题里有一个答不上来,就属于“实施证据不足”,此时分析效果没有意义。
可执行动作:先拉一份按天、按分流组的命中量清单,和计划中的目标对象数量对照。如果命中量明显低于预期,先排查覆盖条件;如果命中量对得上但指标不动,才进入假设检验环节。这个动作的结果直接决定下一步是修配置还是改假设。
实施链路通常有三处容易断,按顺序查比乱猜快。
这三步里,任何一步的原始记录缺失,都不能用“指标没变”来推断试验无效。记录缺失本身就是一个独立问题。
假设你调整了某个页面模块,预期点击率上升,但一周后没变化。可以按下面的顺序核对,而不是直接下结论:
这组证据的价值在于:它能区分“实施失败”和“假设不成立”。两者对应的下一步动作不同——前者修链路,后者改方案。
第三方估算、平台报告和站内统计的口径往往不同,命中量对不上不一定是实施出错。先确认三者统计的是不是同一批对象、同一时间窗、同一事件定义。口径不一致时,优先以你能直接核对的原始记录为准。
另外,命中量归零或某项统计突然消失,不能单独证明实施正确或错误。它也可能是数据延迟、采样变化、字段改名或上游任务失败造成的。遇到这类现象,先补一条独立验证路径,比如直接查原始日志,再决定是否调整试验。
例外情况是:如果改动本身依赖外部条件(如特定来源流量、特定设备),而这段时间该条件没有出现,那么“没变化”属于预期内结果,不应算作实施失败。此时应延长观察或调整触发条件,而不是重复排查配置。
检查完实施链路后,你会得到两种结论之一。若证据显示实施不完整,下一步是修复覆盖或触发条件,并在修复后重新确认命中量,再重新开始观察。若证据显示实施完整、命中量正常,下一步才是回到假设本身,检查指标定义、样本量和观察窗口是否合理。把这两条路径分开,能避免在实施没跑通时反复修改方案。