Skip to main content
QUICK REVIEW

[論文レビュー] What can you do with a rock? Affordance extraction via word embeddings

Nancy Fulda, Daniel Ricks|arXiv (Cornell University)|Mar 9, 2017
Topic Modeling参考文献 23被引用数 20
ひとこと要約

本論文では、Wikipediaで学習された単語埋め込みを用いて、与えられた文脈で実行可能な行動(アフォーダンス)を抽出する手法を提案する。この手法により強化学習エージェントは無意味な行動を除外でき、テキストベースの環境における学習効率が向上し、人間と同様の行動選択が可能になる。テストされたゲームでは、総ステップ数を最大60%まで削減しながら、報酬の獲得量を維持または向上させた。

ABSTRACT

Autonomous agents must often detect affordances: the set of behaviors enabled by a situation. Affordance detection is particularly helpful in domains with large action spaces, allowing the agent to prune its search space by avoiding futile behaviors. This paper presents a method for affordance extraction via word embeddings trained on a Wikipedia corpus. The resulting word vectors are treated as a common knowledge database which can be queried using linear algebra. We apply this method to a reinforcement learning agent in a text-only environment and show that affordance-based action selection improves performance most of the time. Our method increases the computational complexity of each learning step but significantly reduces the total number of steps needed. In addition, the agent's action selections begin to resemble those a human would choose.

研究の動機と目的

  • テキストベースの環境における大規模な行動空間を有する強化学習エージェントの非効率な探索の課題に対処すること。
  • 手動で作成されたルールや明示的な知識ベースに依存せずに、文脈的に実行可能な行動(アフォーダンス)を同定できるようにすること。
  • 事前学習済みの単語埋め込みからの意味的知識を活用して、探索空間を縮小することで学習効率を向上させること。
  • アフォーダンスに基づく行動選択が、テキストベースのアドベンチャーゲームにおいて収束を早め、人間と同様の行動を示すかどうかを評価すること。
  • 意味的類似度を用いた自由形式かつ動的な行動選択の可能性を検討すること。

提案手法

  • 大規模なWikipediaコーパス上でword2vec埋め込みを学習し、単語の密な意味的表現と文脈的関係を構築すること。
  • ベクトル算術(例:類推推論)を用いて、与えられたオブジェクトに対する可能な行動をベクトル空間から推論すること。
  • オブジェクトと動詞のベクトル間のコサイン類似度を用いて、現在の状態において意味的に妥当な行動(アフォーダンス)を特定すること。
  • Q学習エージェントにアフォーダンス検出モジュールを統合し、意味的に妥当な動詞に制限された行動選択を実現すること。
  • 現在のオブジェクトの意味的近傍上位の単語を用いて、状態ごとに動的に行動集合を拡張する動的行動選択メカニズムを適用すること。
  • テキストベースのゲーム環境において、アフォーダンスに基づく行動選択と、ランダム選択、コンセプトベース、共起性閾値による削減手法を比較すること。

実験結果

リサーチクエスチョン

  • RQ1Wikipediaで学習された単語埋め込みは、非効率な行動を回避できる暗黙のアフォーダンス知識をエンコードしているか?
  • RQ2アフォーダンスに基づく行動の除外は、テキストベースの強化学習環境における学習効率を向上させるか?
  • RQ3アフォーダンスに基づく行動選択は、ランダム選択、ConceptNetフィルタリング、共起性閾値と比較してどのように異なるか?
  • RQ4意味的類似度を用いた自由形式の行動生成は、固定された動詞リストよりも創造的かつ効果的な行動を生み出せるか?
  • RQ5アフォーダンスに基づく選択は、テキストベースのゲームにおいてどの程度人間と同様の行動選択を実現するか?

主な発見

  • アフォーダンスに基づく行動選択により、学習に要するステップ数が著しく削減され、テストされたゲームではサンプル効率が最大60%向上した。
  • 本手法は、ランダムな削減、ConceptNetベースのフィルタリング、共起性閾値による手法よりも優れており、これらはしばしば重要な行動を除外し、性能を低下させた。
  • アフォーダンス検出を用いたエージェントは、人間の選択に類似した行動を早期に開始し、意味的推論の向上が示された。
  • 意味的近傍を用いて動的に行動集合を拡張する自由形式の行動生成メカニズムにより、元の動詞リストに存在しない創造的で文脈に適した行動が生成された。
  • 報酬に基づく探索では、アフォーダンスに基づく除外に比べて性能が劣り、意味的制約が報酬ベースの探索よりも効果的であることが示された。
  • 本手法は多様なテキストベースのゲームにおいても安定した性能向上を示し、大規模な行動空間を持つ複雑な環境でも一貫した改善効果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。