Skip to main content
QUICK REVIEW

[论文解读] Learning Optimal Policies from Observational Data

Onur Atan, William R. Zame|arXiv (Cornell University)|Feb 23, 2018
Advanced Causal Inference Techniques参考文献 21被引用 6
一句话总结

本文提出DACPOL,一种领域对抗神经网络方法,可在无需已知倾向性得分的情况下,从观察数据中学习最优策略。通过最小化观察分布与随机化分布之间的H-散度,DACPOL学习到平衡的表征,从而减少选择偏差,在半合成乳腺癌和Statlog数据集上,其策略损失更低,对无关特征的鲁棒性更强,优于基线方法POEM和IPS。

ABSTRACT

Choosing optimal (or at least better) policies is an important problem in domains from medicine to education to finance and many others. One approach to this problem is through controlled experiments/trials - but controlled experiments are expensive. Hence it is important to choose the best policies on the basis of observational data. This presents two difficult challenges: (i) missing counterfactuals, and (ii) selection bias. This paper presents theoretical bounds on estimation errors of counterfactuals from observational data by making connections to domain adaptation theory. It also presents a principled way of choosing optimal policies using domain adversarial neural networks. We illustrate the effectiveness of domain adversarial training together with various features of our algorithm on a semi-synthetic breast cancer dataset and a supervised UCI dataset (Statlog).

研究动机与目标

  • 解决从观察数据中学习最优策略的挑战,其中选择偏差和缺失反事实数据会阻碍可靠策略评估。
  • 开发一种无需已知倾向性得分的方法,克服现有反事实估计技术的关键局限。
  • 通过最小化观察数据与随机化数据分布之间的H-散度,减少策略结果评估中的估计误差。
  • 在高维动作空间中实现有效策略学习,超越二元处理的限制,扩展了以往局限于两种动作的研究。
  • 提高对会增加逆倾向性得分估计器方差的无关特征的鲁棒性。

提出的方法

  • 提出一个理论界,将从观察数据中学习策略结果的估计误差与观察数据与随机化数据分布之间的H-散度联系起来。
  • 引入一种领域对抗神经网络框架,学习在观察数据与随机化数据分布之间不可区分的表征。
  • 通过超参数λ平衡策略损失与领域对抗损失,优化预测准确率与领域不变性之间的权衡。
  • 采用双流神经网络架构:一个分支预测结果,另一个分支分类领域(源域与目标域),以强制实现领域不变性。
  • 使用对抗训练最小化H-散度,有效在不依赖倾向性得分的情况下平衡不同分布的表征。
  • 通过在观察数据上训练并确保表征对记录策略不变,将该方法应用于策略优化。

实验结果

研究问题

  • RQ1在缺乏已知倾向性得分的情况下,如何从观察数据中学习策略结果时,理论上界定估计误差?
  • RQ2领域对抗训练在多大程度上能减少从观察数据中学习策略时的选择偏差?
  • RQ3与POEM和IPS等现有方法相比,所提出方法在策略损失和对无关特征的鲁棒性方面表现如何?
  • RQ4领域对抗损失权重λ的变化对策略性能和表征平衡有何影响?
  • RQ5无关特征引起的选择偏差如何影响DACPOL与依赖逆倾向性评分方法的性能?

主要发现

  • 在半合成乳腺癌数据集上,DACPOL的策略损失为0.292 ± 0.006,显著优于POEM(0.394 ± 0.004)和IPS(0.397 ± 0.004)。
  • 在Statlog数据集上,DACPOL的损失为0.249 ± 0.015,优于POEM(0.432 ± 0.016)和IPS(0.454 ± 0.017)。
  • DACPOL(0)(即λ = 0)的性能劣于DACPOL,表明领域对抗训练通过平衡表征提升了性能。
  • 随着选择偏差增加(通过提高σ实现),DACPOL相对于DACPOL(0)的性能优势进一步扩大,表明其对偏差数据具有更强的鲁棒性。
  • 在存在无关特征的情况下,DACPOL保持了稳定的性能,而POEM的性能因逆倾向性得分方差增加而显著下降。
  • DACPOL中的领域对抗损失在最优λ处达到最小值,此后性能开始下降,证实了预测能力与领域不变性之间存在最优权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。