Skip to main content
QUICK REVIEW

[論文レビュー] Dialogue Response Ranking Training with Large-Scale Human Feedback Data

Xiang Gao, Yizhe Zhang|arXiv (Cornell University)|Sep 15, 2020
Topic Modeling参考文献 28被引用数 6
ひとこと要約

本稿では、Redditの1億3300万組のヒューマンフィードバックデータ(いいね、返信、スレッドの深さ)を用いてトレーニングされたGPT-2ベースの応答ランク付けモデル、DialogRPTを提案する。タスクを対比較フレームワークとして定式化することで交絡要因を低減し、パーセプトリティに基づくベースラインや人間の好みのアノテーションを上回る性能を示した。フィードバック信号が従来の指標よりも人間の関与度と相関していることを実証した。

ABSTRACT

Existing open-domain dialog models are generally trained to minimize the perplexity of target human responses. However, some human replies are more engaging than others, spawning more followup interactions. Current conversational models are increasingly capable of producing turns that are context-relevant, but in order to produce compelling agents, these models need to be able to predict and optimize for turns that are genuinely engaging. We leverage social media feedback data (number of replies and upvotes) to build a large-scale training dataset for feedback prediction. To alleviate possible distortion between the feedback and engagingness, we convert the ranking problem to a comparison of response pairs which involve few confounding factors. We trained DialogRPT, a set of GPT-2 based models on 133M pairs of human feedback data and the resulting ranker outperformed several baselines. Particularly, our ranker outperforms the conventional dialog perplexity baseline with a large margin on predicting Reddit feedback. We finally combine the feedback prediction models and a human-like scoring model to rank the machine-generated dialog responses. Crowd-sourced human evaluation shows that our ranking method correlates better with real human preferences than baseline models.

研究の動機と目的

  • 文脈の関連性を超えて、現実世界のヒューマンフィードバックを統合することで対話応答のランク付けを向上させること。
  • 応答の魅力を捉えきれないパーセプトリティベースのトレーニングの限界を是正すること。
  • ソーシャルメディアのフィードバック(いいね、返信、スレッド深さ)を人間の好みの代理として用いる大規模かつスケーラブルなデータセットを構築すること。
  • 社会的影響のバイアスを減らすために、直接的なフィードバック回帰ではなく対比較を用いること。
  • フィードバック予測と人間らしいスコアリングを組み合わせたアンサンブルモデルを開発し、人間の好みとの整合性を高めること。

提案手法

  • Redditのコメントスレッドからフィードバック信号(幅=返信数、深さ=スレッドの深さ、updown=いいね数-悪いね数)を抽出する。
  • 同じ文脈に対する2つの応答を比較する1億3300万組の応答ペアをRedditデータから構築する。
  • 対比較に基づくコントラスト学習を用い、GPT-2ベースのモデルをトレーニングし、ペア内のどちらの応答がより魅力的かを予測する。ランキング損失を最小化することで、ペアワイズ比較の結果を最適化する。
  • フィードバック予測モデルの重み付きアンサンブルと、人間対マシン応答データでトレーニングされた人間らしいスコアリングモデルを組み合わせ、最終的な応答ランクを生成する。
  • 人間のキャリブレーションデータを用いてアンサンブルをチューニングし、モデル出力を人間の好みアノテーションと一致させる。
  • 最終モデルを、より多くの関与を引き起こすと予測される応答を優先するように、機械生成応答のランク付けに適用する。

実験結果

リサーチクエスチョン

  • RQ1大規模なソーシャルメディアのフィードバックデータは、対話応答における人間の関与度を予測するモデルのトレーニングに効果的に利用可能か?
  • RQ2直接的なフィードバック回帰と比較して、応答ペアの対比較は交絡要因を低減するか?
  • RQ3フィードバックベースのランク付けは、パーセプトリティベースのベースラインと比較して、実際の人間の好みとどの程度相関しているか?
  • RQ4フィードバック予測と人間らしいスコアリングの組み合わせは、個々のモデルよりも応答ランク付けを改善できるか?
  • RQ5フィードバック信号を統合することで、人間評価において生成された対話応答の質はどの程度向上するか?

主な発見

  • フィードバック予測モデルは人間の全体的な好みとのピアソン相関係数が0.792に達し、パーセプトリティベースラインを著しく上回った。
  • Updown指標(いいね数-悪いね数)が人間の好みと最も強い相関を示した(ρ = 0.518)、次にDepthとWidthが続いた。
  • 人間らしいスコアリング(π₀)を組み込んだアンサンブルモデルは、フィードバックのみのモデルを上回った。これは両者の強みが補い合っていることを示している。
  • モデルのフィッティング係数から、深さ(w=0.48)とUpdown(w=1.0)が強い予測変数であることが判明した。一方、幅(w=-0.50)は、あまりに広がった応答は魅力的でないことを示唆した。
  • 固定された生成モデル(DialoGPT)を用いても、DialogRPTは人間評価においてパーセプトリティベースの方法を上回る応答ランク付けを実現した。
  • 人間評価により、モデルのランク付けが実際の人間の好みと、テストしたすべてのベースラインよりも相関が高いかつ良好であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。