Skip to main content
QUICK REVIEW

[論文レビュー] Contextual Bandits in a Survey Experiment on Charitable Giving: Within-Experiment Outcomes versus Policy Learning

Susan Athey, Undral Byambadalai|arXiv (Cornell University)|Nov 22, 2022
Advanced Bandit Algorithms Research被引用数 7
ひとこと要約

本稿では、処置割り当て確率の減衰を遅くし、政策学習を十分に収集されたアームに制限することで、政策学習を向上させるヒューリスティックを提案する。累積的レギュレートが高いため、標準的なバンディットアルゴリズムに比べて均等なランダム化が政策学習において優れている。中規模の寄付調査実験において、オフ政策評価の正確性が向上する。

ABSTRACT

We design and implement an adaptive experiment (a ``contextual bandit'') to learn a targeted treatment assignment policy, where the goal is to use a participant's survey responses to determine which charity to expose them to in a donation solicitation. The design balances two competing objectives: optimizing the outcomes for the subjects in the experiment (``cumulative regret minimization'') and gathering data that will be most useful for policy learning, that is, for learning an assignment rule that will maximize welfare if used after the experiment (``simple regret minimization''). We evaluate alternative experimental designs by collecting pilot data and then conducting a simulation study. Next, we implement our selected algorithm. Finally, we perform a second simulation study anchored to the collected data that evaluates the benefits of the algorithm we chose. Our first result is that the value of a learned policy in this setting is higher when data is collected via a uniform randomization rather than collected adaptively using standard cumulative regret minimization or policy learning algorithms. We propose a simple heuristic for adaptive experimentation that improves upon uniform randomization from the perspective of policy learning at the expense of increasing cumulative regret relative to alternative bandit algorithms. The heuristic modifies an existing contextual bandit algorithm by (i) imposing a lower bound on assignment probabilities that decay slowly so that no arm is discarded too quickly, and (ii) after adaptively collecting data, restricting policy learning to select from arms where sufficient data has been gathered.

研究の動機と目的

  • アダプティブ実験中に累積的レギュレートを最小限に抑えつつ、その後の政策学習のためのデータ品質を最大化するという妥協を解消すること。
  • 文脈的バンディットによるアダプティブデータ収集が、処置割り当ての不均一性と早期のアーム放棄により、政策学習を損なうかどうかを評価すること。
  • 実験中の参加者福祉をあまり損なわずに、政策学習を向上させる実用的なヒューリスティックを設計すること。
  • 個人化された寄付要請を伴う現実世界の調査実験において、この手法をテストすること。
  • 現実的な実験設定において、アダプティブ収集と均等ランダム化の両方のデータ収集法から得られる政策の価値を比較すること。

提案手法

  • 著者らは、処置割り当て確率にゆっくりと減衰する下限を課すことで、アームの早期放棄を防ぐ修正された文脈的バンディットアルゴリズムを提案する。
  • アダプティブデータ収集後、十分に露出されたアームに限定して政策学習を実施することで、推定の安定性を向上させる。
  • 参加者のアンケート特性に基づいて処置割り当てをガイドするため、結果応答を推定するためにツリー型アンサンブルモデル(TreeBagging)を用いる。
  • データの不均一性とサンプルサイズの変動を想定した、代替のバンディットアルゴリズム(例:BootstrapThompson, BootstrapES, BootstrapTTTS)のシミュレーションスタディを実施する。
  • 均等ランダム化とアダプティブバンディットアルゴリズムの両方のデータを用いて、政策のパフォーマンスを比較する。この比較は、実際のパイロットデータを基準として行う。
  • 最終評価として、第二のシミュレーションスタディを実施し、提案されたヒューリスティックに基づく政策の価値がベースライン手法に比べてどの程度高いかを評価する。

実験結果

リサーチクエスチョン

  • RQ1標準的な文脈的バンディットによるアダプティブデータ収集が、処置割り当ての不均一性により、政策学習の正確性を損なうのか?
  • RQ2累積的レギュレートが増加するとしても、単純なヒューリスティックが、アダプティブに収集されたデータにおける政策学習パフォーマンスを向上させられるか?
  • RQ3中規模実験において、個人化された処置割り当て政策の価値を学習する際、均等ランダム化がアダプティブバンディット手法を上回るのか?
  • RQ4アダプティブ実験において、データの不均一性とサンプルサイズが、政策学習のパフォーマンスにどのように影響するか?
  • RQ5十分に露出されたアームに限定して政策学習を制限することで、オフ政策評価の正確性はどの程度向上するか?

主な発見

  • 均等ランダム化は、標準的な文脈的バンディットアルゴリズムよりも著しく高い価値の政策を生み出し、正則化のすべてのレベルで平均して79%の政策価値の向上を示した。
  • 処置割り当て確率のゆっくりとした減衰と、選択的政策学習を組み合わせた本研究のヒューリスティックは、標準バンディットよりも政策学習パフォーマンスを向上させたが、累積的レギュレートの増加はわずかであった。
  • TreeBagging(50)は、均等ランダム化に対して1期あたりのレギュレートを78.5%〜79.7%まで削減し、レギュレートの最小化において優れたパフォーマンスを示した。
  • 個人化されたターゲティングでさえも、大多数の参加者に対してグリーンピースを最適な選択とし、特定のサブグループに対してはより対立的である慈善団体を選択した。これは、好みに顕著な異質性があることを示している。
  • 均等ランダム化によって収集されたデータを用いた政策学習の価値は、一貫して高く、これは中規模実験においてアダプティブアルゴリズムが政策評価を損なう可能性があることを示唆している。
  • 結果から、標準的なアダプティブアルゴリズムは、効果的なアームを早々に放棄するリスクをはらんでおり、オフ政策評価の信頼性を損なう可能性があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。