Skip to main content
QUICK REVIEW

[論文レビュー] Training Value-Aligned Reinforcement Learning Agents Using a Normative Prior

Md Sultan Al Nahian, Spencer Frazier|arXiv (Cornell University)|Apr 19, 2021
Ethics and Social Impacts of AI被引用数 6
ひとこと要約

本論文では、タスクベースの強化学習と規範的事前知識(行動を規範的または非規範的と分類する言語モデル)を組み合わせたポリシー形状法を提案する。環境のタスク報酬と内的な規範的報酬の両方をバランスさせることで、効果的かつ倫理的に整合した行動を取るエージェントを訓練する。特に、規範的行動とタスク効率が対立する複雑な状況においても、有害でなく利他的な行動を一貫して選択できる。

ABSTRACT

As more machine learning agents interact with humans, it is increasingly a prospect that an agent trained to perform a task optimally, using only a measure of task performance as feedback, can violate societal norms for acceptable behavior or cause harm. Value alignment is a property of intelligent agents wherein they solely pursue non-harmful behaviors or human-beneficial goals. We introduce an approach to value-aligned reinforcement learning, in which we train an agent with two reward signals: a standard task performance reward, plus a normative behavior reward. The normative behavior reward is derived from a value-aligned prior model previously shown to classify text as normative or non-normative. We show how variations on a policy shaping technique can balance these two sources of reward and produce policies that are both effective and perceived as being more normative. We test our value-alignment technique on three interactive text-based worlds; each world is designed specifically to challenge agents with a task as well as provide opportunities to deviate from the task to engage in normative and/or altruistic behavior.

研究の動機と目的

  • タスクパフォーマンスのみを最適化する目的で訓練された強化学習エージェントが、有害または非規範的行動を回避する課題に対処するため。
  • 事前学習済みの規範的分類器をポリシー学習プロセスに統合する手法を開発し、価値に整合した行動を促進するため。
  • タスク報酬と規範的報酬を組み合わせることで、効果的かつより倫理的または利他的に感じられるエージェントが得られるかどうかを評価するため。
  • 規範的目標とタスク目標が対立する可能性のある多様なインタラクティブ環境において、本手法の頑健性をテストするため。
  • 規範的行動が、初期モデルの事前学習を除いては最小限の人的介入で学習可能であることを示すため。

提案手法

  • 本手法は二本の報酬信号を用いる:環境からのもの(タスクパフォーマンス)と、事前学習済みの規範的分類器からのもの(規範的行動)。
  • ポリシー形状技術により、環境的報酬と規範的報酬の両方を重み付き組み合わせで動的にバランスさせる。
  • 規範的事前知識は、Frazierら(2019)のものから微調整された言語モデルであり、社会的期待に基づいて行動記述を規範的または非規範的と分類する。
  • エージェントは、タスク成功と規範的行動選択の両方を促進する複合報酬関数を用いて強化学習で訓練される。
  • 本手法は、TextWorldフレームワークを用いて構築された3つのテキストベースのインタラクティブ環境(Playground, Superhero, Clerk World)で評価される。
  • 報酬重み付けや行動記述の表現に感度があるかどうかを評価するため、GG-shaped, GG-pos, GG-mix などのポリシー形状手法の変種をテストする。
Figure 1: Exemplar question given as a prompt Amazon Mechanical Turk workers. The text in red is one of the admissible action commands to the text world environment.
Figure 1: Exemplar question given as a prompt Amazon Mechanical Turk workers. The text in red is one of the admissible action commands to the text world environment.

実験結果

リサーチクエスチョン

  • RQ1規範的事前知識を効果的に用いて、有害でなく社会的に受け入れられる行動に向かう強化学習ポリシーを形状させることは可能か?
  • RQ2タスク報酬と規範的報酬のバランスが、エージェントのパフォーマンスと倫理的行動にどのように影響するか?
  • RQ3タスク効率と規範的行動選択のトレードオフを処理する際、ポリシー形状手法がどの程度の耐性を示すか?
  • RQ4行動記述の表現に依存して、規範的分類器の感度はどの程度か?また、その影響はエージェント行動にどのように現れるか?
  • RQ5規範的目標とタスク目標が対立する異なる環境間で、本手法は一般化可能か?

主な発見

  • GG-shapedエージェント(環境的報酬と規範的報酬をバランスさせたもの)は、訓練の各段階でベースラインエージェントに比べ2〜6倍の高い規範的行動を達成した。
  • Clerk World環境では、規範的行動がタスク報酬を減少させる状況でも、GG-shapedエージェントは高い規範的パフォーマンスを維持し、GG-pos や GG-mix よりも複雑なトレードオフにおいて優れた性能を示した。
  • GG-pos および GG-mix の変種は、より高い環境的報酬を維持したが、コストのかかる利他的行動を要する環境では高い規範的スコアを達成できなかった。
  • 行動記述の表現が規範的分類に顕著な影響を及ぼし、規範的事前知識が言語的フレーミングに敏感であることが示された。
  • Playground や Superhero といったより単純な環境では、本手法により規範的行動が達成されたが、タスクパフォーマンスが損なわれることなく、効果的であった。
  • 本手法により、初期の事前学習を除いては最小限の人的介入で価値の整合性を達成できることを示し、実世界への展開に向けたスケーラビリティの可能性を示唆している。
Figure 2: Visualization of the Playground room graph
Figure 2: Visualization of the Playground room graph

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。