Ch 1:因果推断的动机
约 620 个字 预计阅读时间 6 分钟
为什么需要 " 因果 "?
统计学擅长描述相关性(association),但相关性不等于因果性:
- 冰淇淋销量与溺水人数高度正相关,但并非冰淇淋导致溺水——两者都受夏天气温驱动
- 医院里病人的平均健康状况比普通人差,但并非 " 去医院让你更不健康 "
仅凭观测数据,我们只能发现 \(X\) 与 \(Y\) 同时出现,无法判断是 \(X\) 导致 \(Y\)、\(Y\) 导致 \(X\)、还是存在共同原因 \(Z\)。
相关 vs 因果
| 相关性(Association) | 因果(Causation) | |
|---|---|---|
| 数学描述 | \(P(Y \mid X)\) | \(P(Y \mid do(X))\) |
| 是否需要干预 | 否(纯观测) | 是(实际或假设干预) |
| 能否用观测数据直接估计 | 是 | 通常不能,需要额外假设 |
核心问题
因果推断要回答的问题是:如果我们(或政策制定者)主动干预,改变某个变量 \(X\) 的取值,\(Y\) 会如何变化?
这与纯粹观测 \(X\) 与 \(Y\) 的联合分布是完全不同的问题。
因果推断的应用场景
- 医学:某种药物是否真正降低了病人的死亡率?
- 经济学:最低工资政策是否导致了失业率上升?
- 教育:小班教学是否提升了学生成绩?
- AI/ML:模型学到的是真正的因果关系,还是仅仅是数据集中的虚假相关?
在这些场景中,我们不仅想知道 "\(X\) 和 \(Y\) 是否相关 ",还想知道 " 改变 \(X\) 会不会真正改变 \(Y\)"。
因果推断的主要工具
| 工具 | 适用场景 |
|---|---|
| 随机对照实验(RCT) | 可以随机分配处理时的黄金标准 |
| 潜在结果框架 | 形式化定义因果效应 |
| 因果图(DAG) | 可视化变量因果结构,辅助识别 |
| 工具变量(IV) | 存在未观测混淆时 |
| 断点回归(RD) | 处理由阈值决定时 |
| 差分中差分(DiD) | 有面板数据,处理前后都有观测时 |
Terms
术语小结
- 相关性(Association):两个变量在统计上同时出现的倾向,用 \(P(Y \mid X)\) 描述
- 因果性(Causation):改变 \(X\) 会导致 \(Y\) 发生变化,用 \(P(Y \mid do(X))\) 描述
- 混淆因素(Confounding Factor):同时影响处理和结果的变量,导致虚假相关
- 随机对照实验(Randomized Controlled Trial, RCT):通过随机分配处理消除混淆的实验设计