前置知识:第一讲的潜在结果、条件可交换性、因果图及条件期望。
核心问题:目标效应在什么条件下可以从数据中得到,又应如何计算?
完成本讲后,应能够:
本讲统一使用 \(A\) 表示处理、\(Y\) 表示结果、\(X\) 表示处理前协变量。默认讨论二值处理和平均处理效应,其他目标会明确说明。
在选择软件或模型之前,应回答:
同一数据上的不同方法可能估计不同目标,不能直接把数值差异解释为算法优劣。
flowchart TD
A[明确目标效应与处理机制] --> B{识别依据}
B --> C[随机分配]
C --> C1[组间比较或设计相符的加权]
B --> D[给定基线信息可交换]
D --> D1[标准化、匹配、IPW、AIPW]
B --> E[存在额外设计或结构]
E --> E1[工具变量]
E --> E2[前后变化与平行趋势]
E --> E3[阈值分配与连续性]
E --> E4[前门中介结构]
这不是从上到下“越复杂越好”的排序。适用方法取决于研究设计与可辩护的假设。
考虑总体平均处理效应:
\[ \tau=E\{Y(1)-Y(0)\}. \]
常用识别条件包括:
对任意 \(a\in\{0,1\}\):
\[ \begin{aligned} E\{Y(a)\} &=E_X[E\{Y(a)\mid X\}] &&\text{全期望公式}\\ &=E_X[E\{Y(a)\mid A=a,X\}] &&\text{条件可交换性}\\ &=E_X[E(Y\mid A=a,X)] &&\text{一致性}. \end{aligned} \]
因此:
\[ \boxed{\tau=E_X\{m_1(X)-m_0(X)\}},\qquad m_a(X)=E(Y\mid A=a,X). \]
离散 \(X\) 时,外层期望写为求和;连续 \(X\) 时写为积分。正值性使需要的条件均值有相应观测支持。
以下为构造数据。假设给定基线水平后可交换,并以这 200 个广告投放单元的协变量构成为标准化目标。
| 历史转化水平 \(X\) | 新策略单元数 | 新策略平均转化效率 | 原策略单元数 | 原策略平均转化效率 | 该层单元总数 |
|---|---|---|---|---|---|
| 历史转化水平较低 | 80 | 65 | 20 | 60 | 100 |
| 历史转化水平较高 | 20 | 85 | 80 | 80 | 100 |
转化效率沿用第一讲的定义,单位为次/千人;各投放单元采用相同预算和评估口径。
原始均值差:
\[ \bar Y_1=\frac{80\times65+20\times85}{100}=69, \]
\[ \bar Y_0=\frac{20\times60+80\times80}{100}=76. \]
所以未经调整的差异是 \(69-76=-7\) 次/千人。
标准化后:
\[ \widehat{E\{Y(1)\}}=0.5\times65+0.5\times85=75, \]
\[ \widehat{E\{Y(0)\}}=0.5\times60+0.5\times80=70. \]
得到平均效应 \(75-70=5\) 次/千人。反向的原始差异来自两组基线构成不同。此计算的因果解释仍依赖给定基线后的可交换性等假设。
\[ \widehat\tau_{reg}=\frac1n\sum_{i=1}^n\{\widehat m(1,X_i)-\widehat m(0,X_i)\}. \]
计算中每个投放单元都贡献两个预测值,不能只在实际处理组预测 \(Y(1)\)、在实际对照组预测 \(Y(0)\) 后比较,否则两边仍可能使用不同的协变量分布。
若采用无交互的线性模型:
\[ m(a,x)=\beta_0+\beta_Aa+\beta_X^\top x, \]
则预测差恒为 \(\beta_A\)。在模型正确且识别条件成立时,处理系数可以对应 ATE。
若有交互:
\[ m(a,x)=\beta_0+\beta_Aa+\beta_Xx+\beta_{AX}ax, \]
则:
\[ \tau(x)=\beta_A+\beta_{AX}x,\qquad \tau=\beta_A+\beta_{AX}E(X). \]
这时 \(\beta_A\) 只对应 \(X=0\) 的差异。对于 logistic 回归,处理系数属于对数优势比尺度,也不能直接当作平均风险差。
回归标准化容易表达非线性和效应异质性,但依赖结果模型。诊断应关注处理组与对照组的预测支持范围,以及重要交互和非线性是否被忽略。
倾向评分为:
\[ e(X)=P(A=1\mid X). \]
它预测的是处理分配,不是结果。真实倾向评分具有平衡性质:
\[ A\perp X\mid e(X). \]
在给定 \(X\) 可交换及相应支持条件下,可以通过倾向评分进行分层、匹配或加权,降低直接处理高维协变量的难度。
平衡已测变量不等于消除未测混杂。倾向评分模型的预测准确率也不是因果分析质量的唯一标准;如果几乎完美预测处理,反而可能意味着缺少可比较对象。
一名处理者匹配 \(K\) 名对照时,ATT 的简单表达为:
\[ \widehat\tau_{ATT}=\frac1{n_1}\sum_{i:A_i=1}\left(Y_i-\frac1K\sum_{j\in J(i)}Y_j\right). \]
若某些处理者无法匹配而被删除,估计目标可能变为“能够匹配的处理者”的平均效应,不能仍不加说明地称为原总体 ATT。
连续变量的一种标准化均值差为:
\[ SMD=\frac{\bar X_1-\bar X_0}{\sqrt{(s_1^2+s_0^2)/2}}. \]
加权分析应使用与分析一致的加权均值,并说明标准化分母的约定。绝对 SMD 小于 0.1 常作为经验性参考,但不是可交换性成立的证明。
还应检查分布形状、关键交互、极端值和共同支持;仅比较匹配前后的显著性检验 \(p\) 值可能受到样本量变化干扰。
抽样理论中,一个个体被纳入样本的概率越低,其代表的总体部分越多,所以使用纳入概率的倒数加权。因果分析借用这一思想,对实际处理状态出现的概率取倒数。
对处理潜在结果:
\[ \begin{aligned} E\left\{\frac{AY}{e(X)}\mid X\right\} &=\frac{P(A=1\mid X)E(Y\mid A=1,X)}{e(X)}\\ &=m_1(X). \end{aligned} \]
结合标准化识别公式:
\[ \boxed{\tau=E\left\{\frac{AY}{e(X)}-\frac{(1-A)Y}{1-e(X)}\right\}}. \]
因此 HT 形式的估计量为:
\[ \widehat\tau_{IPW}=\frac1n\sum_{i=1}^n\left\{\frac{A_iY_i}{\widehat e(X_i)}-\frac{(1-A_i)Y_i}{1-\widehat e(X_i)}\right\}. \]
若使用真实已知分配概率并满足相应设计条件,可获得设计无偏等性质;把估计倾向评分代入后,不能笼统宣称有限样本严格无偏。
历史转化水平较低层 \(e=0.8\),历史转化水平较高层 \(e=0.2\)。
\[ \widehat\mu_1=\frac1{200}\left(\frac{80\times65}{0.8}+\frac{20\times85}{0.2}\right)=75, \]
\[ \widehat\mu_0=\frac1{200}\left(\frac{20\times60}{0.2}+\frac{80\times80}{0.8}\right)=70. \]
IPW 同样得到 5 次/千人。每个基线层被重新赋予目标总体中的代表性。
Hájek 形式分别归一化两组权重:
\[ \widehat\mu_1^H=\frac{\sum_iA_iY_i/\widehat e_i}{\sum_iA_i/\widehat e_i},\qquad \widehat\mu_0^H=\frac{\sum_i(1-A_i)Y_i/(1-\widehat e_i)}{\sum_i(1-A_i)/(1-\widehat e_i)}. \]
以两者之差估计效应。它在有限样本中一般不同于 HT 形式,常具有较好的数值稳定性,但“归一化”不等于消除了模型偏差。
| 目标 | 处理者权重 | 对照者权重 |
|---|---|---|
| ATE | \(1/e(X)\) | \(1/\{1-e(X)\}\) |
| ATT | \(1\) | \(e(X)/\{1-e(X)\}\) |
ATT 加权让对照组代表处理组的协变量分布。因此选择权重之前必须确定目标。
应检查权重分位数、最大值、两组倾向评分分布、加权后平衡,以及有效样本量:
\[ ESS=\frac{(\sum_iw_i)^2}{\sum_iw_i^2}. \]
建议分别报告处理组和对照组 ESS。极端权重意味着结果可能被少量个体主导。截断权重可减小方差,却可能引入偏差;删除不重叠样本还可能改变目标人群,均应明确报告。
把结果模型和处理模型结合:
\[ \widehat\tau_{AIPW}=\frac1n\sum_{i=1}^n\left[ \widehat m_1(X_i)-\widehat m_0(X_i) +\frac{A_i\{Y_i-\widehat m_1(X_i)\}}{\widehat e(X_i)} -\frac{(1-A_i)\{Y_i-\widehat m_0(X_i)\}}{1-\widehat e(X_i)} \right]. \]
前两项是结果标准化,后两项用观测残差进行加权修正。
先看 \(\mu_1=E\{Y(1)\}\),令可能错设的模型极限为 \(\widetilde m_1\) 和 \(\widetilde e\)。其条件期望为:
\[ \widetilde m_1(X)+\frac{e(X)}{\widetilde e(X)}\{m_1(X)-\widetilde m_1(X)\}. \]
对 \(\mu_0\) 同理。在识别条件及适当正则条件成立时,正确的倾向评分模型,或者正确的两组结果均值模型,可支持 ATE 估计的一致性。
课堂中还可使用残差均值诊断来扩展这一结论:即使两个模型都错,只要处理组与对照组的样本残差均值分别为零,AIPW 的纠偏项就会抵消,估计量仍然一致。因此,带截距的组内回归常可提供额外的双重稳健保障。
把样本分成若干折,在其他折训练 \(\widehat e\) 和 \(\widehat m_a\),在留出折上计算每个人的 AIPW 项,再汇总。这样可以减轻同一样本同时拟合与评估引起的过拟合问题。
要得到常见的渐近正态推断,还需要合适的误差收敛速度、矩条件和支持条件等。交叉拟合改善估计过程,不会创造缺失的因果识别依据。
对处理 \(A\) 和结果 \(Y\),经典后门准则要求调整集合 \(X\):
满足相应图模型条件时,可用:
\[ P(y\mid do(a))=\sum_xP(y\mid a,x)P(x). \]
后门准则是一个易用的充分条件;更一般的调整准则可处理更多结构。本讲不把“某变量同时与处理和结果相关”当作充分的调整依据。
flowchart LR
U[未测共同原因 U] --> A[处理 A]
U --> Y[结果 Y]
A --> M[中介 M]
M --> Y
经典前门条件包括:
识别公式为:
\[ P(y\mid do(a))=\sum_mP(m\mid a)\sum_{a'}P(y\mid m,a')P(a'). \]
直观上,先识别 \(A\) 如何改变 \(M\),再识别干预 \(M\) 如何改变 \(Y\),最后组合起来。并非“测量到中介就可以用前门”;例如存在 \(A\to Y\) 直接路径时,上述经典结构不再满足。
假设 \(P(A=1)=0.5\),\(P(M=1\mid A=1)=0.8\),\(P(M=1\mid A=0)=0.2\)。四个条件均值为:
| \(A=0\) | \(A=1\) | |
|---|---|---|
| \(M=0\) | 50 | 60 |
| \(M=1\) | 70 | 80 |
先按 \(P(A)\) 调整:\(g(0)=55\),\(g(1)=75\)。
于是 \(E\{Y\mid do(A=1)\}=0.2\times55+0.8\times75=71\); \(E\{Y\mid do(A=0)\}=0.8\times55+0.2\times75=59\)。
效应为 12。数字是教学构造,结论以经典前门条件成立为前提。
平台向投放单元随机发放新策略试用邀请 \(Z\),但不是每个受邀单元都采用。实际采用新策略 \(A\) 仍可能受广告主运营能力影响。
工具变量需要相关性、独立性及排除限制:
若邀请附带通用投放建议,即使未采用新策略也改善转化效率,排除限制就可能被破坏。
对二值工具和二值处理,加入一致性、适当随机性及单调性 \(A(1)\ge A(0)\) 等条件,Wald 比值识别依从者局部平均效应:
\[ \tau_{LATE}=\frac{E(Y\mid Z=1)-E(Y\mid Z=0)}{E(A\mid Z=1)-E(A\mid Z=0)}. \]
例如邀请使平均转化效率增加 3 次/千人,使采用概率增加 0.30,则 LATE 为 \(3/0.30=10\) 次/千人。分子是邀请的意向处理效应,比例调整后是邀请改变了采用状态的人群的平均处理效应。
不能不加假设地把这个 10 次/千人推广为所有目标投放单元的 ATE。
线性设定中,第一阶段用 \(Z\) 和基线 \(X\) 解释 \(A\);第二阶段用第一阶段预测的 \(A\) 和 \(X\) 解释 \(Y\)。应使用正式 IV/2SLS 推断,不能把第二阶段当作普通回归直接读取标准误。
弱工具会使估计不稳定。第一阶段相关性的统计证据不能证明排除限制和独立性成立。
令 \(G=1\) 为政策实施组,\(G=0\) 为对照组,\(t=0,1\) 为实施前后:
\[ \widehat\tau_{DID}=(\bar Y_{1,1}-\bar Y_{1,0})-(\bar Y_{0,1}-\bar Y_{0,0}). \]
| 组别 | 政策前 | 政策后 | 变化 |
|---|---|---|---|
| 实施组 | 70 | 80 | 10 |
| 对照组 | 68 | 74 | 6 |
估计效应为 \(10-6=4\) 次/千人。
关键假设涉及未处理潜在结果:
\[ E\{Y_1(0)-Y_0(0)\mid G=1\}=E\{Y_1(0)-Y_0(0)\mid G=0\}. \]
它不要求两组政策前水平相同,而要求若没有政策,两组平均变化相同。还需无提前反应、恰当处理溢出效应及样本组成变化等问题。
多个政策前时期有助于检查趋势是否明显冲突,但政策前趋势检验未拒绝不能证明政策后的反事实趋势成立。
两组两期的直观结论不应直接推广到不同时间接受政策的多组设计。效应异质时,传统双向固定效应系数可能组合了难以解释的比较,应重新明确组别、时间及目标参数。
设运行变量为 \(R\),阈值为 \(c\),处理规则为 \(A=1(R\ge c)\)。如果阈值两侧未处理和处理潜在结果的条件均值连续,则:
\[ \tau_{RDD}=\lim_{r\downarrow c}E(Y\mid R=r)-\lim_{r\uparrow c}E(Y\mid R=r). \]
第一项表示从右侧接近阈值,第二项表示从左侧接近。它识别阈值附近的局部效应,不是全体人的平均效应。
若资格跨过阈值只提高处理概率,并非完全决定处理,则属于模糊断点。结果跳跃除以处理概率跳跃,在额外工具变量式条件下识别局部依从者效应。
独立样本、配对样本、班级整群随机化和按地区实施政策的数据,不能一律使用相同标准误。聚类通常应考虑处理分配或误差相关的层级;聚类数较少时尤其需要合适的小样本处理。
匹配估计的推断需考虑匹配结构与对照重复使用;固定近邻匹配下,普通非参数 bootstrap 并非总有效。加权和双重稳健估计还应考虑模型估计的不确定性。
在独立同分布、识别与正则条件成立且采用合适交叉拟合等条件下,令 \(Q_i\) 为 AIPW 方括号内的个体项,可用:
\[ \widehat\phi_i=Q_i-\widehat\tau,\qquad \widehat{SE}(\widehat\tau)=\sqrt{\frac{1}{n(n-1)}\sum_i\widehat\phi_i^2}. \]
大样本正态近似区间为 \(\widehat\tau\pm1.96\widehat{SE}\)。这一公式不应直接用于具有复杂聚类或未满足收敛条件的数据。
敏感性分析问的是:“某个无法直接验证的假设偏离到什么程度,会改变当前结论?”
可围绕未测混杂、权重截断、匹配规则、结果模型、失访机制、DID 比较组或 RDD 带宽开展。不同分析应保持目标明确,不能把更换了目标总体后的结果一致当作同一效应的重复验证。
| 方法 | 主要识别依据 | 常见目标 | 核心诊断 |
|---|---|---|---|
| 随机化试验 | 已知分配机制 | 分配效应或依从条件下处理效应 | 随机化执行、失访、依从性 |
| 回归标准化 | 给定基线可交换 | ATE、ATT 等 | 模型、支持与目标分布 |
| 匹配 | 给定基线可交换 | 常为 ATT | 平衡、匹配损失、重叠 |
| IPW/AIPW | 给定基线可交换 | ATE、ATT 等 | 极端权重、ESS、平衡 |
| 前门 | 特定中介图结构 | 干预分布或总效应 | 三项图条件及支持 |
| IV | 外生工具与额外条件 | LATE 或结构参数 | 第一阶段与工具的实质依据 |
| DID | 未处理潜在结果平行趋势 | 实施组的政策效应 | 预趋势、提前反应、比较组 |
| RDD | 阈值处连续性与分配规则 | 阈值局部效应 | 操纵、带宽、其他跳跃 |
构造处理前变量 \(X\)、处理 \(A\) 和结果 \(Y\),令真实效应为 5。让 \(X\) 同时影响处理与结果。
提交要求:明确的数据生成式、一张方法比较表、权重与平衡诊断、约 500 字结果解释。单次模拟接近真值不能作为方法有效性的证明。
\(m(a,x)=50+3a+2x+ax\),目标总体 \(E(X)=4\)。ATE 是多少?
答案:\(m(1,x)-m(0,x)=3+x\),所以 ATE 为 7。处理系数 3 只对应 \(X=0\)。
处理组权重为 1,对照组权重为 \(e(X)/(1-e(X))\),主要针对什么目标?
答案:ATT。加权对照组用于表示处理组的反事实结果。
匹配后所有已测变量 SMD 小于 0.1,能否宣称因果效应已经识别?
答案:不能。它提供已测协变量平衡的诊断,不证明没有未测混杂,也不替代一致性和支持条件。
两个模型都错,但分别带截距拟合两组结果,组内残差均值为零。AIPW 是否仍有一致性保障?
答案:有。组内残差均值为零使 AIPW 纠偏项平均抵消,从而保证双模型错设时仍能恢复目标均值。这说明残差均值检查可作为双重稳健之外的一项充分诊断。
随机邀请提高采用率 0.2,平均转化效率提高 1.4 次/千人。条件成立时 Wald 估计是多少、对应谁?
答案:\(1.4/0.2=7\) 次/千人,对应被邀请改变了实际采用状态的依从者。
实施组政策前后从 60 变为 75,对照组从 65 变为 72,DID 为多少?
答案:\((75-60)-(72-65)=8\)。因果解释依赖未处理潜在结果的平行趋势等条件。
阈值处估计效应为 4 次/千人,能否认为所有目标投放单元平均提高 4 次/千人?
答案:不能。断点效应针对阈值附近人群,向远离阈值的投放单元推广需要额外假设。
主读:苗旺等《因果推断的统计方法》第 3 节、第 4.1 节和第 6.1 节;Pearl 综述的识别、后门与前门部分。
方法补充:《Horvitz–Thompson estimation》用于理解倒概率加权的抽样理论基础;《倾向值分析:统计方法与应用》用于匹配设计与诊断;《基本无害的计量经济学》作为 IV、DID、RDD 的延伸阅读。本讲例题是教学构造,不是书中实证结果。
本研究估计【目标人群】接受【明确定义的处理】相对于【对照】对【结果及测量时间】的【效应类型】。依据【研究设计或识别条件】,使用【估计方法】得到效应为【数值及单位】,相应区间为【区间】。分析检查了【关键诊断】。解释依赖【不能完全验证的假设】,结果适用于【人群和情境】,对【外推或模型限制】仍存在不确定性。
导航:第一讲 · 第三讲:因果发现与方向识别。