Skip to main content
QUICK REVIEW

[論文レビュー] Contrastive Learning Reduces Hallucination in Conversations

Weiwei Sun, Zhengliang Shi|arXiv (Cornell University)|Dec 20, 2022
Topic Modeling被引用数 7
ひとこと要約

本稿では、検索済みの知識とモデルが生成する知識からハードネガティブサンプリングを用いたミックス対照学習を採用することで、大規模言語モデル(LM)ベースの対話システムにおける幻覚を低減するMixCLという対照学習フレームワークを提案する。MixCLは応答の事実性と関連性を向上させ、外部知識ベース(KB)手法と同等の性能を達成しながらも、推論時に検索を必要とせず、5倍速くスケーラブルである。

ABSTRACT

Pre-trained language models (LMs) store knowledge in their parameters and can generate informative responses when used in conversational systems. However, LMs suffer from the problem of "hallucination:" they may generate plausible-looking statements that are irrelevant or factually incorrect. To address this problem, we propose a contrastive learning scheme, named MixCL. A novel mixed contrastive objective is proposed to explicitly optimize the implicit knowledge elicitation process of LMs, and thus reduce their hallucination in conversations. We also examine negative sampling strategies of retrieved hard negatives and model-generated negatives. We conduct experiments on Wizard-of-Wikipedia, a public, open-domain knowledge-grounded dialogue benchmark, and assess the effectiveness of MixCL. MixCL effectively reduces the hallucination of LMs in conversations and achieves the highest performance among LM-based dialogue agents in terms of relevancy and factuality. We show that MixCL achieves comparable performance to state-of-the-art KB-based approaches while enjoying notable advantages in terms of efficiency and scalability.

研究の動機と目的

  • 大規模言語モデル(LM)ベースの対話システムにおける幻覚問題に対処すること。ここでの幻覚とは、ありそうな応答を生成するが事実とは異なる、あるいは関連性のない応答を生成することを指す。
  • オープンドメインで知識に基づく対話において、内在的幻覚(例:誤った事実)と外在的幻覚(例:話題から外れた応答)を低減すること。
  • 推論時に外部知識ベースや検索に依存せずに、LMが生成する応答の忠実性と関連性を向上させること。
  • LMのパラメータから暗黙の知識を効果的に抽出するのを明示的に最適化する対照学習フレームワークを構築すること。
  • KBベースの手法と同等の性能を達成しながら、推論の効率性とスケーラビリティを著しく向上させること。

提案手法

  • ミックスアップデータ増強にインspiredされた、新しいミックス対照学習目的関数を提案。トレーニング中にポジティブおよびネガティブな知識スパンを組み合わせる。
  • 2種類のネガティブサンプリングを導入:(1) デンスリtrievalを用いてコーパスから得たハードネガティブサンプル、(2) 自己ブートストラップにより生成されるモデル生成ネガティブサンプル(誤解を招く知識を模倣)。
  • エンティティベースおよび構文的構造ベースのミックスアップ戦略を用いて、スパンレベルで多様で困難なネガティブ例を生成。
  • ミックス対照損失、LM事前学習損失(MLE)、ネガティブサンプリング目的関数を組み合わせたマルチ目的損失を用いて、モデルをエンドツーエンドで最適化。
  • 二重ブランチアーキテクチャを採用し、モデルが生成した応答を、正解応答およびハードネガティブ知識表現と対照的に比較。
  • トレーニング時に知識を内部化することで、推論時に検索を不要にし、効率的な推論を可能にする。

実験結果

リサーチクエスチョン

  • RQ1対照学習を用いることで、ありそうなが誤りである知識と対照させることで、LMベースの対話システムにおける幻覚を低減できるか?
  • RQ2検索から得たハードネガティブサンプルと、モデル生成によるハードネガティブサンプルの両方が、正しい知識と誤解を招く知識を区別する能力を向上させるか?
  • RQ3スパンレベルでのミックス対照学習は、標準的な対照学習やMLE学習に比べ、応答の事実性と関連性を向上させるか?
  • RQ4純粋にLMベースのアプローチが、KBベースの手法と同等の性能を達成しながら、著しく効率的であるか?
  • RQ5MixCLは、対話固有のデータに対する微調整中に知識の忘却をどの程度軽減するか?

主な発見

  • Wizard-of-Wikipediaデータセットにおける専門家がアノテートした応答を用いた評価で、MixCLはベースラインのBARTに比べ、内在的幻覚を24%、外在的幻覚を27%低減した。
  • 自動評価指標(KF1やF1)において、MixCLは以前のLMベースの手法に比べ、応答の関連性と事実性を5%〜15%向上させた。
  • 推論時間において5倍速く、応答品質において最新のKBベース手法(例:KnowledGPT)と同等の性能を達成した。
  • アブレーションスタディの結果、ミックス対照損失とハードネガティブサンプリングの両方が不可欠であることが確認され、両方を除去すると性能が最大15%低下した。
  • 人間評価では、MixCLがベースラインに比べ、より魅力的で事実に忠実かつ人間らしい応答を生成することが確認された。
  • スケーラビリティに優れる:モデルサイズが大きくなるほど性能向上が顕著であり、KBベース手法よりも顕著に顕著な向上が見られた。これは、事前学習済み知識をより効果的に活用できていることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。