讲义04 选题中的统计方法与应用

讲义04 选题中的统计方法与应用

高级统计学方法 · 2026 年秋季 · 选题应用篇

本讲义把同学们的研究问题转化为可执行的统计分析。学习重点是先明确要估计什么、比较对象是否可信,再选择模型。完成学习后,应能为自己的选题写出处理、结果、分析单位、目标效应、识别假设、估计方法与检验方案,而不只是列出方法名称。

学习安排

建议分四次课堂使用,每次 90 分钟:第一次学习第 1—3 节并计算邮件实验效应;第二次学习第 4—7 节并讨论观察数据与政策评估;第三次学习第 8—10 节并评价个性化投放;第四次学习第 11—14 节并开展选题方法诊断。附录保留选题原名,方便按姓名查找阅读路径。

讲义中的“可考虑”表示候选分析路径,是否能使用取决于数据与识别条件。需要优化的选题用于解释方法边界,不代表已经完成对应实证分析。标注“教学假设”的数字仅用于演示;Hillstrom 例题的样本数与转化数来自本地作业附件的实际复算。

1 从研究问题走向目标效应

1.1 先写出一条完整的问题

“广告是否有效”还不能直接分析。应改写为:“在本次实验所覆盖的用户中,随机分配营销邮件,相对于不发邮件,是否提高随后观察窗口内的购买概率?”这句话同时确定了人群、处理、比较状态、结果和时间。

每份方案先填写七个字段:分析单位是谁;处理何时发生;比较状态是什么;结果何时测量;哪些变量在处理前测量;目标人群是谁;缺失、流失及抽样怎样发生。横截面问卷尤其要说明时间顺序,不能把同时测到的相关性直接写成因果机制。

统一记号:A 为处理,Y 为结果,X 为处理前协变量,Y(1) 和 Y(0) 为同一单位在两种处理状态下的潜在结果,e(X) 为接受处理的概率。每个单位只能观察一个潜在结果,因此没有办法直接从真实数据读出每个人的“真实增量”。

\[ATE=E[Y(1)-Y(0)],\qquad ATT=E[Y(1)-Y(0)\mid A=1]\] \[CATE(x)=E[Y(1)-Y(0)\mid X=x]\]

ATE 是目标总体平均效应;ATT 是实际处理者的平均效应;CATE 是特征相似人群的条件平均效应。三者的目标人群不同,数值不同不一定意味着某个方法算错了。

随机分组 Z 与实际接受 A 不一致时,按 Z 比较得到的是分配效应 ITT;满足工具变量条件后,才可能估计服从者的局部平均处理效应 LATE。周牧伯的广告比较研究首先要区分这两个目标,不能把 RCT 的 ITT 与 IV 的 LATE 之差都解释成“估计偏差”。

1.2 三个基础识别条件

一致性要求处理定义清晰、观察到的结果等于实际处理状态下的潜在结果。不同广告内容混成一种“触达”时,应说明研究的是怎样的内容组合。单位之间存在传播、同伴影响或市场替代时,还要讨论干扰问题。

条件可交换性要求给定 X 后,两组的潜在结果具有可比性。这不是通过回归显著性或机器学习准确率能够验证的。正值性要求目标人群中每类 X 都有机会进入两组;倾向得分接近 0 或 1 时,依赖模型外推会很强。

画图时至少区分三类变量:处理前共同原因 X→A 与 X→Y;中介 A→M→Y;碰撞点 A→C←U→Y。估计总效应时通常不控制处理后的中介,也不因“变量多”就控制碰撞点。以游戏参与度为例,活动发生前的活跃度可能是混杂因素,活动之后的活跃度可能是中介,两者不能用同一个时间口径。

1.3 方法选择速查

数据与问题首选起点主要前提
随机分组后比较购买或评分均值差、回归调整、多臂实验分组机制与流失可核查
观察数据中调整已测混杂回归、匹配、加权、AIPW无遗漏混杂与共同支持
存在外生鼓励或真实资格阈值IV 或 RDD排除限制或断点连续性
多地区多时期政策实施DID、事件研究、分期 DID平行趋势、无提前反应
一个或少数地区受到政策冲击SCM、SDID有足够前期和可信供体
高维协变量下估计平均效应DML原识别条件仍成立
想知道谁更受益或如何分配名额CATE、因果森林、策略评价独立评价与可识别的效应
只需预测下一时刻结果Logit、GAM、预测模型无信息泄漏、外部验证

2 随机实验与多因素实验

2.1 均值差是必须报告的基准

随机分配能使处理前因素在重复实验意义下可比。分析前先核对随机化单位、分配比例、重复记录、实验流失和观察窗口。没有显著的基线差异不能证明随机化成功;出现少量显著差异也不必然说明实验失效。

\[\widehat\tau=\overline Y_1-\overline Y_0,\qquad \widehat{SE}(\widehat\tau)=\sqrt{s_1^2/n_1+s_0^2/n_0}\]

上式适用于独立单位两组均值比较的常见近似。若按学校、城市或账号随机化,标准误应体现该层级;有分层或配对随机化时,应按设计分析。二元 Y 的差值是概率差,通常报告为“百分点”。

2.2 Hillstrom 邮件实验计算例题

上官彬欣附件内的 CSV 共 64,000 行。按 segment 分组复算 conversion,得到以下结果。此处展示原始实验全样本平均效应,不是个性化策略的测试集成绩。

实验组用户数转化人数转化率
Mens E-Mail21,3072671.2531%
Womens E-Mail21,3871890.8837%
No E-Mail21,3061220.5726%

Mens E-Mail 相对 No E-Mail 的概率差为 267/21307 − 122/21306 = 0.006805,即提高约 0.681 个百分点。以独立伯努利样本的代入标准误进行正态近似,95% 置信区间约为 0.500—0.861 个百分点。也可以理解为每 1,000 名符合该实验条件的用户,平均增加约 6.8 次转化。

这里不能写成“提高 0.681%”:概率的绝对变化与相对增长率不是同一指标。也不能写“每一位用户都会增加 0.681 个百分点”,因为这是平均效应。若同时检验男装、女装邮件与对照等多个比较,应明确主要比较,并对探索性比较报告多重检验处理。

2.3 三臂实验与内容匹配

康羽琪的研究涉及不发、男装邮件、女装邮件。保留三个处理臂,分别估计男装对不发、女装对不发、男装对女装,才能讨论内容差异。合并成“发邮件/不发邮件”估计的是混合邮件策略,不能据此判断哪种内容更合适。

可用两个处理虚拟变量及预先指定的处理前特征交互项。比较某类用户的男装与女装效应时,要直接检验两者之差;“一组显著、另一组不显著”不等于组间差异显著。历史购买、历史品类偏好可以用于分组;邮件发出后是否点击不宜作为总效应分析的控制变量。

2.4 因子实验与重复评分

AI 来源标签、内容类型、呈现方式如果分别随机化,可以构成因子实验。以两个二元因素 A、B 为例:

\[E[Y\mid A,B]=\alpha+\beta_A A+\beta_B B+\beta_{AB}AB\]

在 0/1 编码下,βA 是 B=0 时 A 的效应,βAB 是 A 的效应在 B 两种状态下的差;βA 不是自动等于跨 B 平均的主效应。应报告各实验条件预测均值,再计算研究需要的对比。

张璐需要先核实实验究竟有哪些条件,不能由文件数量推断为完整的 2×2×2 设计。唐心语的创意实验要区分作者被分配到的 AI 条件与作者自愿使用 AI 的行为。前者有随机化依据,后者可能反映作者能力或动机差异。[参考资料 1]

3 回归模型与结果变量的尺度

3.1 OLS 与二元结果模型

连续结果可从 OLS 开始:Y=α+τA+βX+ε。二元结果可使用线性概率模型或 Logit。线性概率模型的处理系数容易解释为概率差,但可能产生区间外预测并存在异方差;Logit 把预测限制在 0—1,但其系数是对数优势比尺度,不能直接当作概率变化。

\[\operatorname{logit}(p_i)=\log\frac{p_i}{1-p_i}=\alpha+\tau A_i+\beta^{\top}X_i\]

更容易交流的做法是对每个人分别预测 A=1 与 A=0 的概率,求差后平均,报告平均边际效应或标准化风险差。这个计算只有在相应因果识别条件成立时才有因果含义;否则是模型调整后的关联。

控制变量应由时间顺序和因果结构决定。为追求显著性反复增加、删除控制项,会使最终不确定性被低估。观测数量很大时,也要报告效应大小与实际意义,不能只有 p 值。

3.2 有序 Logit 与主观幸福感

冯睿博的幸福感等级、黄俊杰的信任等级具有顺序,但相邻等级之间的距离未必相等。有序 Logit 的一种写法是:

\[P(Y\le k\mid A,X)=\Lambda(\kappa_k-\tau A-\beta^{\top}X),\quad k=1,\ldots,K-1\]

这里采用“阈值减去线性预测项”的符号约定;τ 为正意味着更倾向于较高等级。比例优势假设要求处理在各累计阈值上的系数相同。应检查该假设,必要时考虑部分比例优势或其他有序模型,并以各等级预测概率解释结果。

互联网使用频率应先按原分类呈现,不宜未经论证就把 1—5 看作等距离连续刻度。若探索倒 U 形,可比较类别模型与平滑曲线,报告有数据支持的范围,不以一个负的二次项就宣布“过度使用反噬”。

CGSS 题号必须回到问卷核对。不同量表的方向、分支与适用人群可能不同;结构性跳答不能当一般随机缺失填补。出生年份中大于 99 的值也不能按通用缺失规则删除。变量含义错了,换任何模型都无法修正。

4 倾向得分匹配与加权

4.1 匹配是在构造可比样本

倾向得分 e(X)=P(A=1X) 汇总处理前协变量对处理选择的预测。PSM 先估计倾向得分,再为处理者寻找可比对照,最后比较结果。它只处理已测量且正确纳入的混杂;不能自动消除动机、能力等未观测差异。

陈家荣使用 NSW 处理样本与 PSID 对照样本时,研究已是跨来源观察比较。数据名称含有培训实验,不代表拼接后的样本仍然随机。应先确定 ATT,核对两组招募机制,再检查支持域和平衡性。

推荐顺序:选择处理前变量;检查原始差异;设定匹配距离、卡钳及是否放回;检查匹配后协变量分布;报告剔除人数;最后估计效应和不确定性。不能先看结果显著不显著,再挑匹配规格。

\[SMD=\frac{\overline X_1-\overline X_0}{\sqrt{(s_1^2+s_0^2)/2}}\]
常用SMD<0.1 作为提示性目标,但不是证明无混杂的定理。还要看方差、分布尾部和关键非线性关系。该方案材料中年龄匹配后 SMD 约 0.270,提示仍需优化,而不是只展示倾向得分图就结束。

4.2 IPW 与重叠权重

ATE 的逆概率权重是处理组 1/e、对照组 1/(1−e);ATT 常用处理组 1、对照组 e/(1−e)。报告估计目标,才能判断权重是否选对。

\[\widehat\tau_{IPW}=\frac1n\sum_i\left\{\frac{A_iY_i}{\widehat e(X_i)}-\frac{(1-A_i)Y_i}{1-\widehat e(X_i)}\right\}\]

上式为未归一化形式;组内归一化形式在有限样本中会不同。极端权重会放大噪声,应报告权重分布、截尾规则和有效样本量 ESS=(Σw)²/Σw²。截尾可能改变偏差与目标解释,不能把“加权后显著”作为选择规则。

重叠权重在处理组使用 1−e,对照组使用 e,强调两种处理都有可能的人群,目标是重叠人群效应 ATO,而不是原总体 ATE。马均昊的标题策略研究可考虑这一目标,同时控制账号、发布时期和处理前内容属性,并处理同账号相关性。

放回匹配会重复使用对照,标准误必须反映这种依赖。不能把复制出来的行视作独立观测;也不能笼统认为任何 bootstrap 都适用或都不适用,应按匹配算法与目标采用有依据的解析或重抽样方案。[参考资料 2]

5 双重稳健估计与双重机器学习

5.1 AIPW 的两部分修正

设 m₁(X) 与 m₀(X) 分别为两组条件结果均值。AIPW 把结果预测差与加权残差修正相加:

\[\widehat\tau=\frac1n\sum_i\left[\widehat m_1(X_i)-\widehat m_0(X_i)+\frac{A_i\{Y_i-\widehat m_1(X_i)\}}{\widehat e(X_i)}-\frac{(1-A_i)\{Y_i-\widehat m_0(X_i)\}}{1-\widehat e(X_i)}\right]\]

在基础因果条件、适当正则性与估计条件下,倾向模型或结果模型有一方一致,可以获得一致的平均效应估计。这就是“双重稳健”的核心含义。它不意味着遗漏混杂也能纠正,不意味着两模型都差时依然可靠,也不意味着不需要共同支持。

5.2 DML 为什么需要样本外残差

机器学习擅长拟合复杂的 X→A、X→Y 关系,但直接把拟合值带入同一数据的效应估计可能产生过拟合偏差。DML 使用正交得分并交叉拟合,降低辅助模型误差对目标参数的一阶影响。[参考资料 3]

以部分线性模型为例,假设 Y=θA+g(X)+ε,且 E(εA,X)=0。记 ℓ(X)=E(YX)、m(X)=E(AX),使用每个样本所在折之外的数据训练辅助模型:
\[\widetilde Y_i=Y_i-\widehat\ell^{(-k)}(X_i),\quad \widetilde A_i=A_i-\widehat m^{(-k)}(X_i),\quad \widehat\theta=\frac{\sum_i\widetilde A_i\widetilde Y_i}{\sum_i\widetilde A_i^2}\]

实施时将样本分成 K 折,在其他折训练,在留出折预测,汇总样本外残差,再用相应正交得分计算标准误。调参也只能使用训练部分。若存在同一用户或城市的重复记录,应按独立单位分折。

部分线性 DML 的 θ 在常数效应模型下具有相应处理效应解释;存在一般异质性时,它不自动等于总体 ATE。二元处理、目标为 ATE 时,可考虑基于交互回归模型的 AIPW 型 DML。论文必须写出目标与得分,不能只写“采用 DML”。

5.3 在选题中如何使用

赵佳佳可以把随机实验均值差作为基准,比较加入处理前变量后的精度与稳定性,不能把全样本实验点估计叫作已知真值。杨璐宁即使使用 PSM 与 DML,若数据是合成数据,结果也应解释为模拟数据上的方法演示,而不能推断真实玩家的因果反应。

张佳慧需要先获得同一分析单位上可连接的话术、处理时间与购买结果。给公开购买数据人工配上虚构文本,只能构成明确的数据生成实验。文本特征丰富不等于真实混杂已经充分测量。

6 工具变量与断点回归

6.1 工具变量要解释作用路径

工具 Z 要满足相关性、外生性与排除限制;解释 LATE 通常还需要单调性及清楚的处理定义。二元鼓励、二元处理的 Wald 比率为:

\[\widehat\tau_{LATE}=\frac{E[Y\mid Z=1]-E[Y\mid Z=0]}{E[A\mid Z=1]-E[A\mid Z=0]}\]

分子是鼓励对结果的 ITT,分母是鼓励对实际处理的影响。分母很小时弱工具问题严重。报告第一阶段、弱工具诊断及适当的弱工具稳健推断;第一阶段显著并不能验证排除限制。

卢悦麟提出父母教育作为本人教育的工具时,应考虑父母教育是否通过家庭资源、婚育观念直接影响生育意愿。黄俊杰提出社区互联网变量时,也要考虑社区经济与社会环境是否直接影响信任。仅加入若干控制变量不能自动关闭这些路径。

广告随机资格可作为实际曝光的候选工具,但必须核实资格是否只通过该曝光影响结果、是否有其他广告替代以及单调性是否合理。不能把公开文件中的 treatment 与 exposure 两列不加审查地送入两阶段最小二乘。

6.2 RDD 的断点来自制度

当运行变量 R 跨过真实阈值 c 时,接受处理的概率发生跳跃,才能考虑 RDD。锐断点的局部效应为:

\[\tau_{RD}=\lim_{r\to c^+}E[Y\mid R=r]-\lim_{r\to c^-}E[Y\mid R=r]\]

关键条件是没有处理时的潜在结果在阈值处连续、单位不能精确操纵排序,并且没有其他制度同时在该阈值变化。若处理概率只部分跳跃,模糊 RDD 使用结果跳跃除以处理概率跳跃。

应画原始分箱图,采用阈值两侧局部拟合,报告带宽和稳健偏差校正区间,并做密度、协变量连续性、带宽与伪断点检查。避免全样本高阶多项式主导结论。[参考资料 4]

莫丰宁的青年就业研究只有在某个年龄确实触发政策资格或待遇变化时,才有相应年龄 RDD。把样本按年龄中位数切开,或自行规定“青年/非青年”,不会产生外生断点。RDD 的结论也首先适用于阈值附近,而非全部青年。

7 DID 事件研究与合成控制

7.1 两组两期 DID

\[\widehat\tau_{DID}=(\overline Y_{T,post}-\overline Y_{T,pre})-(\overline Y_{C,post}-\overline Y_{C,pre})\]

DID 用对照组变化近似处理组未受政策时的变化。核心是未处理潜在结果的平行趋势,还要讨论提前反应、构成变化、溢出和同时发生的政策。单位与时间固定效应只是模型写法,不能代替这些条件。

陈广源的材料若只使用 2010—2020 年数据,却把 2003 年后的观测统一设为政策后,那么没有政策前对比,无法识别其原定 DID。增加固定效应、合成控制或 DML 都不能生成缺失的前期。可以另行研究不同出生队列的暴露差异,但那需要重新定义处理和识别设计。

7.2 分期实施与事件研究

张衡的便民生活圈、苏品睿的金融政策、陈霆飞的平台监管均可能涉及不同时间实施。传统双向固定效应在效应异质、错位实施时可能混合不合适的比较。可先估计“首次处理年份为 g 的组在 t 期”的 ATT(g,t),使用从未处理或尚未处理单位作对照,再按明确权重汇总。[参考资料 5]

事件时间是 t−g。画动态效应时写明参照期、置信区间与每个事件时间的组别支持。政策前系数不显著不证明平行趋势成立,尤其在样本少、区间宽时。政策后时间越长,可用的处理批次可能越少,不能把构成变化误认为真实动态。

张衡应核对城市政策名单、首批时间、区县试点归属与消费口径。若研究期止于 2023 年,2024 年才处理的城市在观察窗口内尚未处理;它们能否作为对照还取决于是否提前反应。结果变量缺失后的插值可能人为平滑趋势,必须披露并做不插值分析。

7.3 吴政泽的三重差分

当前 QCEW 设计考察加州快餐最低工资,比较加州与其他地区、政策前后、快餐与全服务餐饮三个维度。可先在每个州每季度构造两个行业的对数结果差 D,再对 D 做州与季度的 DID。

\[\tau_{DDD}=\{\Delta Y_{CA,fast}-\Delta Y_{CA,full}\}-\{\Delta Y_{other,fast}-\Delta Y_{other,full}\}\]

识别要求未受政策时,这个行业差距在加州与对照地区具有可比变化。全服务餐饮也可能受工资溢出或劳动力替代影响,不能天然视为完全不受影响。只有一个处理州时,不能靠大量行业季度记录就声称有大量独立政策实验;应考虑空间安慰剂、供体敏感性与少处理簇推断的局限。

QCEW 行业就业总量不能直接回答青少年就业问题,因此该设计的结果解释应与第二次作业的题目一致。题名保留在附录,但估计对象应随实际数据校正。

7.4 SCM 与 SDID

SCM 用多个未处理单位的加权组合构造处理单位的反事实,通常约束单位权重非负且和为 1。先报告政策前拟合质量,再看政策后差距,并用供体删除、伪处理时间及空间安慰剂评估稳定性。前期拟合好只是必要的支持证据,不排除同期独有冲击。

SDID 结合单位权重、时间权重与差分思想。常见标准形式的单位和时间权重都具有非负且归一化约束;不能为了表现方法复杂而描述为任意负权重模型。它仍需要政策前后数据和适当未处理单位。[参考资料 6]

只有一条能耗序列时,可考虑中断时间序列:控制季节、天气、负荷及自相关,估计干预后的水平或斜率变化。若使用 BSTS/CausalImpact,控制序列应不受干预影响,而且前期关系应能延续到后期。谭淮峰需要重点排查算法上线是否与设备更新、产量调整同时发生。[参考资料 7]

8 异质性效应与因果森林

8.1 从平均效应到谁更受益

CATE 是相似 X 人群的平均处理效应。预测某个人购买概率高,并不表示给这个人发邮件的增量高。教学假设:甲不发也有 30% 概率购买,发后 31%;乙不发为 2%,发后 8%。甲的购买概率更高,乙的增量更高。

异质性变量必须在处理前可获得,且未来实施策略时也能获得。用处理后点击率寻找“高增量人群”,会混淆选择与效果,并可能在部署时根本无法使用。

8.2 常见学习器

方法基本构造重点风险
S-learner一个模型拟合 Y 与 A、X,再比较两个 A 预测正则化可能弱化处理效应
T-learner两组分别拟合结果模型后求差小组样本少时预测差不稳定
X-learner先拟合结果,再构造伪效应并组合依赖各阶段模型与组合规则
R-learner对结果与处理残差化,学习条件效应重叠差处有效信息不足
因果森林面向效应差异分裂并局部估计不能补救遗漏混杂与缺乏支持

T-learner 最直观的表达是 τ̂(x)=m̂₁(x)−m̂₀(x)。但两个结果模型都预测得好,也不保证差值估计得好。方法比较应围绕效应、排序或策略价值,而不只是 Y 的预测 AUC。

8.3 因果森林怎样学习

普通随机森林倾向于寻找结果不同的子群;因果森林关注处理效应差异。Honesty 将用于决定分裂的数据与用于叶节点效应估计的数据分开,有助于控制自适应拟合问题。它与交叉拟合相关但不是同一概念。[参考资料 8]

报告时先给总体平均效应,再给预先指定的子组差异、样本外排序分组效果及区间。变量重要性表明变量帮助预测异质性,不意味着对该变量进行干预会改变处理效应。

侯思宇、鄢忠萍、曾浩翔可用“均值差→简单交互→T-learner→因果森林”的顺序建立复杂度基准。康羽琪若有三种内容,应定义每种内容相对对照的效应,不能仅估计一个二元森林后声称完成内容匹配。

9 固定预算下的策略评价

9.1 独立训练与评价

上官彬欣的 20% 触达名额问题需要比较至少三种策略:随机选择 20%、按购买概率选择 20%、按预测增量选择 20%。保持人群、预算、结果窗口相同,才能公平比较。

先按独立用户划分训练集与测试集;训练集内调参、选择变量、确定策略;冻结后在测试集评价一次。若在测试集上反复挑最优模型或名额比例,测试集已经参与训练。交叉拟合辅助模型不能自动代替独立策略评价。

设 π(X) 为是否触达的规则,预算约束 E[π(X)]≤0.2。测试集观察的 A 未必等于该规则推荐的处理,因此不能只计算“被选中且确实收到邮件者”的转化率。

9.2 用双重稳健得分评价增量

在第 5 节 AIPW 中,每位用户对应一个处理效应得分 Γ̂ᵢ。以不触达为基准,策略的总体人均增量可估计为:

\[\widehat{\Delta V}(\pi)=\frac1{n_{test}}\sum_{i\in test}\pi(X_i)\widehat\Gamma_i\]

随机实验可使用已知分配概率;辅助结果模型应以样本外方式得到。如果只保留男装与不发两臂,要使用该二臂子样本中的分配概率,不能沿用三臂中男装的原始概率。

比较两个策略应对同一测试样本上的 [π₁(Xᵢ)−π₂(Xᵢ)]Γ̂ᵢ 进行推断,利用配对关系,而不是把两个估计当独立。若存在聚类,区间要体现聚类。条件于已经训练好的规则进行评价,与把整个训练过程的不确定性都纳入评价,是两种不同推断任务。

9.3 AUUC 与 Qini 不等于利润

AUUC、Qini 描述增量排序及累计收益曲线。不同软件对归一化、随机基准、横轴和多臂处理的定义可能不同,必须写清公式或实现口径。它们不是每个人真实因果效应的直接测量。

要讨论商业净收益,需要购买金额、毛利、触达成本等。若只观察 conversion,最多评价增量转化,不应把它直接命名为 ROI。Criteo 公开样本经过发布方处理与抽样,外推真实投放总体的绝对增量还要遵守数据说明,不能从匿名特征恢复不存在的品牌、人口属性或推荐机制。[参考资料 9]

10 中介 调节与机制解释

10.1 中介不是增加一个控制变量

胡睿熙的“营销活动→参与度→付费”、李笑语的“角色→评价威胁→披露”关注作用机制。总效应问处理是否改变结果;中介效应问改变通过怎样的路径发生。估计总效应时控制中介,可能主动删掉研究想估计的一部分效果。

在线性、无交互且满足识别条件的特定模型下,可以用路径系数乘积表示间接效应。一般情况下要使用潜在中介 M(a) 与潜在结果 Y(a,m) 定义。平均因果中介效应的一种表达是:

\[ACME(a)=E[Y(a,M(1))-Y(a,M(0))]\]

它涉及在保持处理状态时改变中介分布,需要比总效应更强的假设。即使 A 随机化,M 通常没有随机化,中介与结果之间仍可能有未测混杂,特别要警惕处理诱导的中介—结果共同原因。应明确时间顺序、可识别条件并做敏感性分析。[参考资料 10]

SEM 可以表示多个路径和潜变量,但良好拟合并不能证明路径具有因果方向。横截面“逐步回归显著”不足以证明因果中介;可以谨慎报告与假设机制一致的关联证据。

10.2 调节效应是效应随条件变化

若处理前 W 改变 A 的效应,可加入 A×W。在线性模型中,W=w 时效应为 βA+βAWw。连续 W 应画效应曲线与区间,避免随意用中位数分组损失信息。在 Logit 等非线性模型中,乘积项系数不直接等于概率尺度的交互,宜计算预测概率对比。

马可、金子熙的机制研究应先把“谁在什么时候被操纵”写清楚,再决定哪些是中介、哪些是处理前调节因素。同一个心理变量不能在没有时间解释时同时承担多个角色。

11 重复测量 联合分析与复杂数据

11.1 多行记录不等于多个独立人

一个人评价三段材料、一个作者被多名评价者评分、一个账号发布多条视频,都形成相关观测。忽略相关性会把有效信息量夸大。可考虑聚类稳健标准误、广义估计方程或混合模型,选择取决于研究目标与数据结构。

\[Y_{ij}=\beta_0+\beta_1A_{ij}+\beta^{\top}X_{ij}+u_i+\varepsilon_{ij}\]

这是一个随机截距示意:uᵢ 表示同一人的共同差异。若作者和评价者是交叉结构,可考虑两个随机效应或适合设计的多维聚类。不要把“加了随机效应”理解为自动控制所有内生性。

唐心语应按原实验的作者分组估计 ITT,处理重复评价;比较作品相似度时,一个作品可能参与多对比较,作品对不能简单当作独立样本。

11.2 CGSS 随机情境与测量有效性

李笑语的 CGSS 方向涉及多次情境评价,应核对 B101、B102、B103 对应情境属性及 X1_1—X6_3 等编码,整理成“受访者×情境”的长表。若属性确实随机化,可估计属性对评价的平均边际成分效应,并按受访者处理相关性;具体模型仍要遵循原调查随机化规则。

BMI 是体重与身高构成的体型指标,不等于“体型压力”。若 A14 体重单位为斤,要先换算为千克,再计算 kg/m²。题项 A15 的身体健康也不能直接重命名为抑郁。需要心理压力或抑郁时,应使用确实测量该概念的题项并承认单题的局限。

复杂抽样调查还应说明权重、分层与抽样单位。若目标是代表总体的描述或平均效应,是否使用调查权重必须与目标一致;权重不能弥补题项测量错误或遗漏混杂。

12 预测 GAM 与时间验证

12.1 预测任务有独立的评价标准

吴嘉翔的逐球胜率研究回答“给定比赛当前状态,最终获胜概率是多少”。这本身是合理的预测问题,不必强行包装为因果推断。某个状态变量帮助预测获胜,不意味着干预该变量会产生相同幅度的胜率变化。

先建立比分、局数、发球权和赛前实力的 Logit 基准,再考虑 GAM 的平滑项。GAM 保留可解释的加性结构,允许比分差等变量产生非线性关系;平滑程度通过惩罚控制,不应无限追求训练集贴合。[参考资料 11]

\[\operatorname{logit}(p)=\alpha+f_1(\text{score gap})+f_2(\text{pre-match strength})+\beta^{\top}Z\]

12.2 防止逐球数据泄漏

同一场比赛的球不能随机散落到训练和测试两边,否则模型可能利用同场相关性。应按比赛分组,并尽量按日期做前训后测。赛前 Elo 只能使用此前比赛更新;最终赛季排名、最终比分及未来状态不能作为当前预测输入。

终局状态胜率天然接近 0 或 1,混入大量终局记录会使成绩过于好看。应分别报告不同比赛阶段表现,明确实际使用时点。

\[Brier=\frac1n\sum_i(p_i-y_i)^2,\qquad LogLoss=-\frac1n\sum_i[y_i\log p_i+(1-y_i)\log(1-p_i)]\]

Brier 与 LogLoss 越小越好。校准图检查“预测 70% 的场景是否约有 70% 获胜”;AUC 反映排序,不能代替校准。区间或重抽样也应按比赛组织,而不是把每一球当作完全独立样本。

13 其他选题需要的扩展方法

13.1 多触点广告与生存分析

何美丽的渠道研究先要定义“转化前哪些触点可观测、未转化者观察到何时”。有转化时间与右删失时,可用生存模型描述转化速度;时间变化曝光要按发生顺序组织。Cox 系数是条件风险比,不是累计转化概率差,也不能天然解释为渠道增量。

若早期广告改变后续参与度,而参与度又影响后续广告选择与最终购买,就存在受既往处理影响的时间变化混杂。此时普通回归控制全部参与度可能不合适,可进一步学习边际结构模型与纵向 g 方法;它们仍依赖逐时点可交换性、正值性及正确时间信息。

最后点击归因和 Shapley 分摊是在给定规则下分配贡献,若输入的价值函数没有因果识别依据,分摊结果不会自动成为因果效应。最小可行方案可先聚焦两个渠道的随机组合实验与交互对比。

13.2 文本处理与测量误差

张佳慧的话术、马均昊的标题研究需要把文本转成可重复的处理定义,例如是否包含价格利益诉求。先制定编码规则并人工标注一部分样本,再检验分类一致性、误判类型和不同类别的表现。分类器置信度不是处理真实性。

处理定义应先于结果分析。标题是否改写、发布日期、曝光窗口与购买归因窗口都要记录。播放量可能受标题影响,若用它作控制或把互动除以播放量,估计目标会改变,应分别讨论总互动与曝光条件下的互动率。

13.3 元分析与证据综合

王月伶若只能取得论文中的汇总结果,可选择元分析;如果获得某项实验原始数据,则可以复现该实验。两条路径的数据单位不同。元分析以研究或独立效应量为单位,需预先界定干预、对照、结果、纳入标准,并把效应量转换到可比较尺度。

随机效应模型同时考虑研究内抽样误差与研究间异质性。报告汇总效应、区间、异质性和敏感性分析;同一研究的多个结果不能作为完全独立研究重复计权。身份标签、实际内容来源与播报者类型属于不同干预,不能仅因都涉及 AI 就直接合并。[参考资料 12]

13.4 模拟实验与因果发现

陈圳伟的方法比较可在明确的数据生成过程中设置真效应,再重复模拟,评价偏差、RMSE、区间覆盖率和不同样本量下的稳定性。至少改变混杂强度、重叠程度和函数非线性,不以单次模拟结果判定算法优劣。

因果发现方法如 PC、GES 需要额外假设,输出可能是等价类而非唯一方向。有向边不自动等于可干预效果;潜在混杂、时间顺序与测量误差都可能影响结构发现。相关基础可接续讲义03,本篇不把发现算法当作现有选题识别缺口的通用补丁。

14 分析交付与课堂练习

14.1 一份可复核分析至少交什么

提交一张变量表,包含来源、原题号、编码、时间、单位与缺失规则;一张样本流程图,说明每步排除人数;一段目标效应与识别假设;一个简单基准估计;一个与主方法相匹配的诊断;一张报告效应大小和区间的结果表;以及数据处理和分析代码。

匹配报告平衡与支持域,DID 报告政策时点与动态比较,IV 报告第一阶段并讨论排除限制,预测报告样本外校准,策略学习报告独立测试集价值。不要给所有方法都套同一组“稳健性检验”。

把主要结果、次要结果和探索性分析分开。没有显著结果不等于没有效应,应结合区间讨论哪些效应大小仍与数据相容。多个方法一致可以增加对部分建模选择的信心,但共享同一遗漏混杂时也可能一起出错。

14.2 课堂练习

练习一:用第 2 节数据计算女装邮件相对不发邮件的概率差。它是否证明女装邮件比男装邮件更有效?

练习二:一位同学发现 PSM 后处理系数显著,所有协变量的 p 值都大于 0.05,于是声称消除了选择偏差。指出至少两处问题。

练习三:随机广告资格使实际曝光概率增加 0.20,使购买概率增加 0.004。在满足 IV 条件时,Wald 估计是多少?它与 ITT 是否同一个目标?

练习四:政策在 2003 年实施,所有数据来自 2010 年以后。为什么不能通过把 post 全设为 1 完成 DID?需要补充什么或怎样重建设计?

练习五:模型甲 AUC 高于模型乙,但甲选择的前 20% 用户在独立实验测试集中的增量低于乙。购买预测与投放选择应分别怎样评价?

练习六:同一受访者评价三个人物情境,把所有评分作为独立样本会有什么问题?如果属性随机化、BMI 没有随机化,两类系数的解释是否相同?

14.3 参考答案与讨论要点

一:189/21387 − 122/21306 ≈ 0.003111,即约 0.311 个百分点。它是女装对不发的差;男装与女装的直接差异需独立计算对比及区间,并考虑多重比较,不能通过两个 p 值判断。

二:p 值受样本量影响,不是平衡程度的充分指标;应看 SMD、分布与支持域。PSM 只调整已测且纳入的变量,不能证明未测混杂消失。匹配后的标准误还需考虑算法与对照重复使用。

三:0.004/0.20=0.02,即服从者平均增加 2 个百分点;ITT 是分配广告资格的平均效应 0.4 个百分点。LATE 的目标人群与处理定义均有区别。

四:缺乏前期,无法形成差分中的时间对比。可补充政策前数据及可信对照,或依据真实制度构造队列暴露等新的设计;不能只换估计器。

五:购买预测使用样本外概率误差、校准和排序指标;投放策略在相同预算下评价增量或净收益。高购买概率人群可能本来就会购买。

六:同一受访者评分相关,应在模型或推断中体现。随机属性的效应可在设计条件下解释为因果效应;BMI 与评价的关系仍可能有混杂,而且 BMI 不能直接代表心理压力。

参考资料

  1. Doshi 与 Hauser 创意实验公开数据:Dryad 数据与说明。用于核查实验条件与数据结构。
  2. MatchIt 官方方法说明:匹配后效应估计与推断
  3. DoubleML 官方文档:模型与正交得分。区分 PLR 与 IRM 等不同目标。
  4. rdrobust 官方项目:局部多项式与稳健断点推断
  5. Callaway 与 Sant’Anna 的 did 官方教程:分期处理的组别时间效应
  6. Arkhangelsky 等 Synthdid 官方项目:Synthetic Difference in Differences
  7. Google 官方教程:CausalImpact 与控制序列假设
  8. GRF 官方指南:因果森林与广义随机森林
  9. Criteo 发布说明:Uplift 数据集官方数据卡。版本、抽样与变量含义应分别核对。
  10. Imai、Keele 与 Yamamoto(2010):因果中介效应的识别 推断与敏感性分析,Statistical Science,25(1),51—71。
  11. mgcv 官方手册:广义加性模型
  12. metafor 官方项目:元分析模型与效应量

附录 按姓名查找选题与方法

原题名按现有材料保留;未单列标题的记录不代拟文章名。第二次作业有可读正文时列出其中题名或原文表述;无新增可读正文时,阅读路径仅依据前次选题,不据此判断本次内容质量。下列提示是方法学习的优先事项,详细逐项评阅仍见选题补充清单。

纪辞暮戏

原题名:暂无选题材料

尚无选题材料,暂不指定方法。

胡睿熙

原题名:游戏内营销活动如何影响玩家消费行为?——基于玩家参与度中介机制的因果推断研究

材料范围:本次无新增可读正文,方法对应依据前次选题。

阅读路径:第 1、4、10 节。

优先事项:先区分活动前参与度与活动后参与度,再讨论总效应和中介路径。

吴政泽

原题名:最低工资上调对青少年就业的动态影响

基于县级分期实施政策的多期双重差分研究计划书

第二次作业题名或原文表述:加州快餐业20美元最低工资对就业与工资的影响——基于QCEW数据的三重差分研究

阅读路径:第 7 节。

优先事项:以当前 QCEW 行业就业与工资为结果,重点检查行业差距趋势及单处理州推断。

马森妍

原题名:文献综述与研究方案:计算广告增量效应的因果推断与反事实评估

第二次作业题名或原文表述:广告投放真的能带来更多网站访问吗?——以 Criteo 展示广告数据为例

阅读路径:第 2、8、9 节。

优先事项:以随机资格和网站访问定义主要效应,实际曝光与随机资格分别解释。

卢悦麟

原题名:未单列选题标题

第二次作业题名或原文表述:教育对居民生育意愿的因果效应评估

——基于CGSS数据的工具变量分析

阅读路径:第 3、6、10 节。

优先事项:先论证父母教育的排除限制,核实问卷编码与婚姻、收入的时间角色。

何美丽

原题名:论文研究方案设计——基于因果交互效应的多触点广告归因分解研究

材料范围:本次无新增可读正文,方法对应依据前次选题。

阅读路径:第 2、10、13 节。

优先事项:统一转化时间窗口与渠道先后顺序,区分贡献分摊和可识别的渠道增量。

侯思宇

原题名:数字广告触达对消费者转化的因果效应及异质性研究:基于 Criteo Uplift 实验数据的实证分析

第二次作业题名或原文表述:数字广告触达因果效应研究的数据方法和分析过程说明

阅读路径:第 2、8、9 节。

优先事项:从实验均值差出发,在独立测试集评价异质性排序与投放规则。

夏宏博

原题名:暂无选题材料

尚无选题材料,暂不指定方法。

金子熙

原题名:品牌资产在小红书数字化种草情境中的作用及其对消费者消费路径的因果影响

——文献综述与研究方案设计

材料范围:本次无新增可读正文,方法对应依据前次选题。

阅读路径:第 2、7、10 节。

优先事项:优先收敛为一个可实施的实验或政策设计,品牌资产的中介或调节身份需明确。

王晟苏

原题名:大型内容更新对 Steam 游戏玩家活跃度的因果影响

材料范围:本次无新增可读正文,方法对应依据前次选题。

阅读路径:第 7 节。

优先事项:核实更新事件、对照游戏、预热与促销,并处理同一游戏重复更新。

鄢忠萍

原题名:基于因果推断的个性化推荐对用户转化行为的增量效应研究

材料范围:本次无新增可读正文,方法对应依据前次选题。

阅读路径:第 2、8、9 节。

优先事项:先确认处理变量确实对应研究中的干预,不能把广告资格直接解释为推荐机制。

上官彬欣

原题名:高购买概率还是高因果增量:有限触达名额下营销邮件用户选择策略的因果评估——基于 Hillstrom 随机邮件实验

第二次作业题名或原文表述:高购买概率还是高因果增量——基于 Hillstrom 随机邮件实验

阅读路径:第 2、8、9 节。

优先事项:固定 20% 名额、冻结选择规则,用同一测试集对策略差异进行配对推断。

苏品睿

原题名:数字普惠金融政策对居民家庭消费的因果效应评估:基于多期DID与因果森林

材料范围:本次无新增可读正文,方法对应依据前次选题。

阅读路径:第 7、8 节。

优先事项:先识别政策平均效应;异质性扩展应遵循面板设计,不能简单把政策虚拟变量送入横截面森林。

吴嘉翔

原题名:基于逐球数据的排球比赛动态胜率预测研究——以2025赛季NCAA一级女排为例

第二次作业题名或原文表述:基于逐球数据的排球比赛动态胜率预测研究——以2025赛季NCAA一级女排为例

阅读路径:第 3、12 节。

优先事项:按比赛和时间划分样本,使用赛前信息,报告校准与分阶段预测表现。

周牧伯

原题名:数字广告曝光的因果增量能否被观测方法准确恢复?——基于 Criteo 随机增量实验的 RCT、IV、DML 与异质性效应比较

第二次作业题名或原文表述:Criteo 广告增量数据集:数据来源、方法说明与数据处理流程

阅读路径:第 2、5、6、8 节。

优先事项:分别写出 ITT、LATE 与观测曝光效应,目标不同的数值不直接作偏差比较。

黄俊杰

原题名:互联网使用是否能够提高居民幸福感——基于CGSS数据的因果推断

第二次作业题名或原文表述:互联网使用对居民社会信任水平的因果影响

阅读路径:第 3、6 节。

优先事项:当前材料改为社会信任;先核实题项,再讨论有序结果模型与工具变量路径。

陈圳伟

原题名:人工智能辅助的政策评估因果推断

材料范围:本次无新增可读正文,方法对应依据前次选题。

阅读路径:第 5、13 节及讲义03。

优先事项:根据前次 AI 政策方法方向学习;本次空附件文件名不能作为选题改变的证据。

康羽琪

原题名:营销促销触达的增量效应识别与个性化投放优化——基于公开田野实验数据的因果推断研究

第二次作业题名或原文表述:高流失风险客群的促销唤醒增量与触达内容匹配——基于服装邮购零售随机田野实验的因果推断研究

阅读路径:第 2、8、9 节。

优先事项:保留三个处理臂,直接检验内容差异;历史购买间隔仅是风险代理。

冯睿博

原题名:互联网使用与老年人主观幸福感:促进效应还是“过度使用”反噬?——基于CGSS2021的有序Logit、倾向得分匹配与中介效应分析

第二次作业题名或原文表述:基于CGSS2021的互联网使用频率与老年人主观幸福感关系研究

阅读路径:第 3、4、10 节。

优先事项:先把有序量表、频率分类和缺失规则做对;横截面分析谨慎使用因果措辞。

李笑语 CGSS 方向

原题名:未单列选题标题

第二次作业题名或原文表述:未单列选题标题

阅读路径:第 3、10、11 节。

优先事项:区分 BMI 与体型压力,核查斤与千克转换、情境随机属性和重复评价结构。

李笑语 AI 披露方向

原题名:向AI抑或人类倾诉痛苦:社会角色对抑郁自我披露意愿的影响

——感知评价威胁的中介与面子顾虑的调节

材料范围:本次无新增可读正文,方法对应依据前次选题。

阅读路径:第 2、10、11 节。

优先事项:先确认角色操纵与评分结构,感知评价威胁的中介分析需要额外识别假设。

杨璐宁

原题名:移动游戏「激励视频广告 vs 内购」的因果替代与互补关系研究——文献综述与研究方案设计

第二次作业题名或原文表述:游戏参与度对内购付费行为的因果效应研究——基于倾向得分匹配与双重机器学习的实证分析

阅读路径:第 4、5、13 节。

优先事项:先确定参与度处理的时间与尺度;合成数据只能支持明确的模拟或方法演示。

陈家荣

原题名:基于倾向得分匹配的职业培训项目因果效应研究——以 Lalonde 数据为例

第二次作业题名或原文表述:职业培训项目的因果效应:数据和方法说明与分析过程说明

——基于 LaLonde 数据集与倾向得分匹配方法

阅读路径:第 4、5 节。

优先事项:当前拼接样本按观察研究分析,修复年龄平衡和支持域描述,并考虑放回匹配的依赖。

唐心语

原题名:AIGC 数字人代言的边界条件

产品类型与拟人化程度的因果机制

第二次作业题名或原文表述:AI 会让创意变得更好,还是变得更像?

——基于公开随机实验数据的生成式 AI 创意效果研究

阅读路径:第 2、10、11 节。

优先事项:按公开实验的分配条件估计 ITT,并处理作者、评价者及作品相似度的相关性。

莫丰宁

原题名:最低工资政策对青年就业的异质性影响——基于断点回归与双重差分结合的实证分析

材料范围:本次无新增可读正文,方法对应依据前次选题。

阅读路径:第 6、7 节。

优先事项:只有真实资格或待遇阈值才支持 RDD,青年年龄分组本身不构成断点。

王月伶

原题名:人工智能在新闻自动化生产中的应用与影响研究

第二次作业题名或原文表述:人工智能背景下作者身份标签

对新闻可信度的影响

阅读路径:第 2、13 节。

优先事项:先选择原始实验复现或元分析,区分身份标签与实际内容来源。

谭淮峰

原题名:未单列选题标题

材料范围:本次无新增可读正文,方法对应依据前次选题。

阅读路径:第 7、12 节。

优先事项:先核查干预时间、对照序列、天气负荷与同期设备调整。

张衡

原题名:智慧城市试点政策对城市居民消费水平的影响

第二次作业题名或原文表述:一刻钟便民生活圈试点政策对城市居民消费水平的影响:数据构思说明

阅读路径:第 7 节。

优先事项:核对分期名单、区县与城市对应、尚未处理对照及消费指标缺失处理。

陈广源

原题名:高等教育扩张对劳动者收入的因果效应:基于双重差分法、合成控制法与双重机器学习的比较研究

第二次作业题名或原文表述:统计学结课作业补充材料:数据、方法与分析过程详解

阅读路径:第 1、7 节。

优先事项:先解决没有政策前样本的问题;DML 与合成控制不能补出政策前观测。

曾浩翔

原题名:未单列选题标题

材料范围:本次无新增可读正文,方法对应依据前次选题。

阅读路径:第 8、9 节。

优先事项:先界定真实处理与观察窗口,再评价固定预算下的因果增量。

张璐

原题名:AI 生成内容显式标识对社交媒体信息可信度判断与分享意愿的因果效应

第二次作业题名或原文表述:AI生成内容来源标识对中国网民信息真实性判断与传播意愿的因果效应研究:基于心理科学数据中心公开实验数据的实证分析

阅读路径:第 2、10、11 节。

优先事项:取得并核对原始实验数据后确认因子结构、随机化单位与重复测量。

陈霆飞

原题名:数字平台监管政策对居民媒介信息接触行为的因果效应评估——基于多期双重差分(csdid)的准自然实验研究

材料范围:本次无新增可读正文,方法对应依据前次选题。

阅读路径:第 7、11 节。

优先事项:政策时点与调查年份对齐,核查跨年媒介接触题项可比性和调查抽样。

马可

原题名:基于因果推断的短视频平台用户点击率影响机制研究——以中介效应与干预实验分析为例

材料范围:本次无新增可读正文,方法对应依据前次选题。

阅读路径:第 2、10 节。

优先事项:优先明确可操纵因素,区分点击率预测、总效应与中介路径。

赵佳佳

原题名:基于因果推断与双重机器学习的数字广告跨渠道增量效应估计

第二次作业题名或原文表述:因果推断方法在邮件营销增量效应估计中的比较研究

——以 Hillstrom 公开随机对照实验数据为例

阅读路径:第 2、5、8、9 节。

优先事项:以 Hillstrom 实验估计作基准而非真值;没有面板结构时不套用 SDID。

马均昊

原题名:品牌视频标题中的利益诉求

对用户互动效果的影响

基于B站官方账号数据的双重稳健估计

材料范围:本次无新增可读正文,方法对应依据前次选题。

阅读路径:第 4、5、13 节。

优先事项:明确标题处理,控制处理前属性,按账号处理相关性并固定互动窗口。

张佳慧

原题名:暂无选题材料

第二次作业题名或原文表述:基于双重机器学习与文本因果森林的直播电商话术对购买转化率的异质性效应评估——固定预算下的精准干预策略

阅读路径:第 5、8、9、13 节。

优先事项:先取得可连接的真实话术与购买结果;文本模型不能替代有效研究数据。