Skip to main content
QUICK REVIEW

[论文解读] Program Targeting with Machine Learning and Mobile Phone Data: Evidence from an Anti-Poverty Intervention in Afghanistan

Emily Aiken, Guadalupe Bedoya|arXiv (Cornell University)|Jun 22, 2022
Poverty, Education, and Child Welfare被引用 5
一句话总结

本研究利用移动电话通话详单记录(CDRs)中的机器学习模型,评估其在阿富汗改善反贫困项目目标定位的效果。研究发现,基于CDRs的模型在识别极度贫困家庭方面,其准确率与传统的基于调查的贫困衡量方法相当;将CDRs与调查数据结合可进一步提高目标定位的精确度,为脆弱环境提供了低成本的替代方案。

ABSTRACT

Can mobile phone data improve program targeting? By combining rich survey data from a "big push" anti-poverty program in Afghanistan with detailed mobile phone logs from program beneficiaries, we study the extent to which machine learning methods can accurately differentiate ultra-poor households eligible for program benefits from ineligible households. We show that machine learning methods leveraging mobile phone data can identify ultra-poor households nearly as accurately as survey-based measures of consumption and wealth; and that combining survey-based measures with mobile phone data produces classifications more accurate than those based on a single data source.

研究动机与目标

  • 评估是否可通过处理移动电话数据的机器学习方法,提升反贫困项目目标定位的准确性。
  • 比较基于CDRs的机器学习模型与传统基于调查的贫困衡量方法(消费水平和资产指数)的表现。
  • 评估在目标定位模型中纳入非手机拥有家庭的影响。
  • 估算基于CDRs的目标定位方法相较于传统方法(如CBT和PMT)的费用节省。
  • 检验将CDRs数据与调查数据结合是否能提升目标定位表现。

提出的方法

  • 本研究使用某主要阿富汗移动运营商的通话详单记录(CDRs),并与‘瞄准极度贫困’(TUP)项目提供的家庭调查数据进行关联。
  • 训练机器学习模型(线性回归、LASSO、随机森林和梯度提升)以预测贫困状况、资产指数和社区财富排名(CWR),输入特征包括CDRs派生的指标,如通话频率、时长、位置信息及社交网络模式。
  • 通过10折交叉验证评估模型性能,二分类任务(贫困状况)使用AUC,连续结果(消费水平、资产指数、CWR)使用R²。
  • 将模型准确率与结合社区财富排名和后续调查的混合基准进行比较。
  • 通过文献数据估算不同目标定位方法下每户筛查的可变成本。
  • 在535户同时拥有CDRs和调查数据的匹配样本上评估模型。

实验结果

研究问题

  • RQ1基于移动电话CDRs训练的机器学习模型能否准确识别阿富汗的极度贫困家庭?
  • RQ2基于CDRs的目标定位表现与传统基于调查的消费水平和资产拥有情况衡量方法相比如何?
  • RQ3在目标定位模型中纳入非手机拥有家庭会对准确性产生何种影响?
  • RQ4将CDRs数据与基于调查的指标结合,是否能提升目标定位准确率,使其优于单独使用任一数据源?
  • RQ5与传统方法(如CBT和PMT)相比,基于CDRs的目标定位在边际成本上能节省多少?

主要发现

  • 基于CDRs的机器学习模型在识别极度贫困家庭方面AUC约为0.80,几乎与基于调查的消费水平和资产指数衡量方法的性能相当。
  • 当非手机拥有家庭被归类为极度贫困时,基于CDRs的模型保持高准确率;但若将此类家庭视为不符合资格,则模型性能显著下降。
  • 将CDRs数据与基于调查的指标(消费水平和资产指数)结合,可实现比单独使用任一数据源更高的目标定位准确率。
  • 基于CDRs的方法将每户筛查的可变成本降低至0.00美元,而CBT为2.20美元,PMT为4.00美元,实现了显著的成本节约。
  • 模型表现最佳的特征包括通话量、通话时长、联系人多样性以及夜间通话行为等时间模式。
  • 梯度提升模型在预测二元贫困状态及连续结果(如资产指数和CWR)方面,始终优于其他算法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。