Skip to main content
QUICK REVIEW

[論文レビュー] Learning Semantic Relatedness From Human Feedback Using Metric Learning

Thomas Niebler, Martin Becker|arXiv (Cornell University)|May 21, 2017
Topic Modeling参考文献 17被引用数 4
ひとこと要約

本論文は、人間のフィードバックを事前学習済み単語埋め込みに組み込むことで、意味的類似度測定を向上させるためのメトリック学習手法を提案する。この手法により、Wikipedia やタグ付けシステムなど多様なデータソースにおいて、人間の直感との整合性が著しく向上する。相対的制約(人間の判断に基づく)を用いることで、標準的なコサイン類似度を上回る性能を示し、意味的類似度予測における堅牢でスケーラブルな改善が実証された。

ABSTRACT

Assessing the degree of semantic relatedness between words is an important task with a variety of semantic applications, such as ontology learning for the Semantic Web, semantic search or query expansion. To accomplish this in an automated fashion, many relatedness measures have been proposed. However, most of these metrics only encode information contained in the underlying corpus and thus do not directly model human intuition. To solve this, we propose to utilize a metric learning approach to improve existing semantic relatedness measures by learning from additional information, such as explicit human feedback. For this, we argue to use word embeddings instead of traditional high-dimensional vector representations in order to leverage their semantic density and to reduce computational cost. We rigorously test our approach on several domains including tagging data as well as publicly available embeddings based on Wikipedia texts and navigation. Human feedback about semantic relatedness for learning and evaluation is extracted from publicly available datasets such as MEN or WS-353. We find that our method can significantly improve semantic relatedness measures by learning from additional information, such as explicit human feedback. For tagging data, we are the first to generate and study embeddings. Our results are of special interest for ontology and recommendation engineers, but also for any other researchers and practitioners of Semantic Web techniques.

研究の動機と目的

  • コーパスベースの意味的類似度測定と人間の直感の間のギャップを解消すること。
  • 明示的な人間のフィードバックを制約として用いることで、既存の単語埋め込みを改善するスケーラブルで柔軟な手法を開発すること。
  • 特に、以前に意味的埋め込みに用いられていなかったタグ付けデータを含む、新しいデータソースにおけるメトリック学習の有効性を検討すること。
  • 学習されたメトリックが、さまざまな人間がアノテートした類似度データセットに一般化するかどうかを評価すること。
  • ユーザーが提供するフィードバックを通じて、パーソナライズドやドメイン特化された意味的類似度モデルを可能にすること。

提案手法

  • 人間による意味的類似度判断に基づき、相対的制約(四重項)を用いたメトリック学習を適用し、既存の単語埋め込みを精緻化する。
  • 高次元スパースベクトルではなく、低次元で密な単語埋め込みを用いることで、意味的表現力の向上と計算コストの低減を図る。
  • 人間のフィードバックを距離制約として符号化する:例えば、単語ペア A-B は C-D よりも類似度が高いと判断される。
  • マージンに基づく最適化を用い、より関連性の高い単語ペア間の距離を最小化し、関連性の低いペア間の距離を最大化するメトリックを学習する。
  • Wikipedia テキスト、ナビゲーション履歴、およびソーシャルタグ付けデータなど、多様なソースから得られる埋め込みに対応できるように、メトリック学習フレームワークを適応する。
  • 標準ベンチマーク(MEN や WS-353)を用いて、学習されたメトリックの性能を、人間の判断との相関性の観点から評価する。

実験結果

リサーチクエスチョン

  • RQ1人間のフィードバックを事前学習済み単語埋め込みに組み込むことで、メトリック学習が意味的類似度測定を著しく改善できるか?
  • RQ2Wikipedia テキスト、ナビゲーションパス、タグ付けデータなど、さまざまなデータソースにおいて、学習されたメトリックの性能はどのように変化するか?
  • RQ3ある人間がアノテートしたデータセットで学習したメトリックが、他の人間がアノテートした類似度データセットへどの程度一般化できるか?
  • RQ4誤った人間のフィードバックやノイズの多いフィードバックで学習した場合、モデルの性能は維持されるか?
  • RQ5タグ付けデータを効果的に意味的単語埋め込みに変換できるか?

主な発見

  • 提案されたメトリック学習手法は、以前に意味的埋め込みに用いられていなかったタグ付けデータを含め、すべてのテスト済みデータソースで意味的類似度測定を著しく向上させた。
  • MEN や WS-353 といったベンチマークデータセットにおいて、標準的なコサイン類似度よりも人間の判断との相関が高くなった。
  • 学習されたメトリックは、さまざまな人間がアノテートしたデータセット間で良好に一般化しており、フィードバックに基づく知識の転送性が示された。
  • 誤ったフィードバックや誤った情報で学習した場合、モデルの性能が低下した。これは、モデルが入力の制約を正確に表現しており、過学習ではないことを確認した。
  • 高次元ベクトルではなく単語埋め込みを用いることで、メトリック学習プロセスにおける意味的表現力の向上と計算コストの低減が達成された。
  • 本研究は、タグ付けデータから埋め込みを生成・分析した初の研究であり、その有用性が意味的類似度タスクにおいて示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。