Skip to main content
QUICK REVIEW

[論文レビュー] Improving Open Language Models by Learning from Organic Interactions

Jing Xu, Da Young Ju|arXiv (Cornell University)|Jun 7, 2023
Hate Speech and Cyberbullying Detection被引用数 4
ひとこと要約

この論文では、匿名化された有機的ユーザー相互作用および実運用からのフィードバックを用いて訓練された、より優れたオープンドメイン言語モデルであるBlenderBot 3xを紹介する。報酬モデルとCringe Lossを活用して、有用な相互作用と攻撃的相互作用の両方から学習することで、モデルは94.4%の応答品質を達成し、安全性が向上し、実際のユーザーデータにおいてエンゲージメントと毒性耐性の両面でBlenderBot 3を上回った。

ABSTRACT

We present BlenderBot 3x, an update on the conversational model BlenderBot 3, which is now trained using organic conversation and feedback data from participating users of the system in order to improve both its skills and safety. We are publicly releasing the participating de-identified interaction data for use by the research community, in order to spur further progress. Training models with organic data is challenging because interactions with people "in the wild" include both high quality conversations and feedback, as well as adversarial and toxic behavior. We study techniques that enable learning from helpful teachers while avoiding learning from people who are trying to trick the model into unhelpful or toxic responses. BlenderBot 3x is both preferred in conversation to BlenderBot 3, and is shown to produce safer responses in challenging situations. While our current models are still far from perfect, we believe further improvement can be achieved by continued use of the techniques explored in this work.

研究の動機と目的

  • キュレート済みまたは合成データに依存するのではなく、現実世界の有機的ユーザー相互作用とフィードバックを用いて対話型AIモデルを改善すること。
  • 攻撃的で有害な行動を含む混合品質のデータから学ぶ課題に対処し、モデル改善に役立つ信号を抽出すること。
  • データ駆動型ファインチューニングを通じて、対話の質(例:エンゲージメント、知識)と安全性(例:毒性の低減)の両方を向上させること。
  • 対話型AI分野における安全で効果的な研究を促進するため、大規模な匿名化済みユーザー相互作用データセットを公開すること。

提案手法

  • モデルは、クラウドワーカーがアノテートしたデータとユーザーが提供したフィードバック(例:良い応答や悪い応答のフラグ)に基づいて訓練された報酬モデルを用いてファインチューニングされる。
  • Cringe Lossが適用され、高品質な応答と、有害で無意味、またはトピック外の出力を生成する確率を同時に最適化する。
  • 訓練データは、BlenderBot 3の実運用から収集された353,000件を超える匿名化された会話と、155,000件のユーザーのフィードバックのインスタンスから構成される。
  • 攻撃的または低品質な相互作用からのノイズを特定・緩和するために、段階的なデータフィルタリングと分析パイプラインが用いられる。
  • 人間によるアノテーションを用いて応答品質と安全性を評価し、元のBlenderBot 3と比較する。
  • ユーザーが理解できるように、表示バナー、データ共有のオプトアウト、リスクと研究の性質を説明するFAQを含む、ユーザー向けの保護措置が導入されている。

実験結果

リサーチクエスチョン

  • RQ1有害な入力が含まれるが、有機的かつ現実世界のユーザー相互作用とフィードバックを用いて、オープンドメイン言語モデルを効果的に改善できるか?
  • RQ2実運用において、有用な行動と有害な行動の両方のユーザー行動にさらされた場合に、モデルが高品質な応答と安全性を維持できるか?
  • RQ3報酬モデリングやCringe Lossのような技術は、実際のユーザーデータにおけるノイズや攻撃的信号から有用なフィードバックを効果的に分離できるか?
  • RQ4キュレート済みまたは合成データではなく、実際のユーザーのフィードバックに基づいてファインチューニングした場合、モデルの安全性とエンゲージメントはどの程度向上するか?
  • RQ5大規模な匿名化済み相互作用データを、対話型AI分野におけるオープンリサーチを支援する形で、責任を持って公開できるか?

主な発見

  • BlenderBot 3xは人間による評価で94.4%の応答品質スコアを達成し、元のBlenderBot 3の85.3%を大きく上回った。
  • 攻撃的会話において、モデルが不適切な応答を生成するのは2.4%にとどまり、元のモデルと同等の水準であり、耐性向上が示された。
  • 標準的な会話において、モデルは85%の割合で高品質な応答を生成したのに対し、人間参加者は75%であったため、優れた対話の整合性を示した。
  • 報酬モデルとCringe Lossを組み合わせた手法により、特に挑戦的な相互作用シナリオにおいて、応答品質と安全性の両面で明確な改善が得られた。
  • 353,000件を超える会話と155,000件のフィードバックインスタンスが収集され、今後の研究を支援するための匿名化済みデータセットとして公開された。
  • 改善が見られたものの、攻撃的プロンプトに対して依然として失敗を示すケースが存在し、アライメントと安全性に関する継続的な研究の必要性が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。