Skip to main content
QUICK REVIEW

[論文レビュー] Knowledgeable Preference Alignment for LLMs in Domain-specific Question Answering

Yichi Zhang, Zhuo Chen|arXiv (Cornell University)|Nov 11, 2023
Topic Modeling被引用数 5
ひとこと要約

この論文では、ドメイン固有の質問応答のためのLLMを強化するために、ドメイン知識グラフを統合し、人間の好みに合わせたアライメントを実現する知識認識型の好みアライメントフレームワーク、KnowPATを提案する。スタイルと知識の好みセットを新たに導入し、独自のアライメント目的関数を用いることで、取得した知識を効果的に活用しながら、信頼性が高くユーザーフレンドリーな回答を生成する点で、15のベースラインを上回る性能を発揮する。

ABSTRACT

Deploying large language models (LLMs) to real scenarios for domain-specific question answering (QA) is a key thrust for LLM applications, which poses numerous challenges, especially in ensuring that responses are both accommodating to user requirements and appropriately leveraging domain-specific knowledge bases. They are the two major difficulties for LLM application as vanilla fine-tuning falls short of addressing. Combining these requirements, we conceive of them as the requirement for the model's preference to be harmoniously aligned with humans'. Thus, we introduce Knowledgeable Preference AlignmenT (KnowPAT), which constructs two kinds of preference sets to tackle the two issues. Besides, we design a new alignment objective to align the LLM preference with different human preferences uniformly, aiming to optimize LLM performance in real-world, domain-specific QA settings. Adequate experiments and comprehensive comparisons with 15 baseline methods illustrate that our KnowPAT is a superior pipeline for real-scenario domain-specific QA with LLMs.

研究の動機と目的

  • 実世界のドメイン固有の質問応答にLLMを導入する際、信頼性が高くユーザーフレンドリーな出力を得る課題に対処すること。
  • 不要な知識や過剰な知識の取得に対処できないヴァナイルファインチューニングの限界を克服すること。
  • 一貫した好みアライメントフレームワークの下で、ユーザーフレンドリーな応答スタイルと正しい知識の活用の両方のニーズを統合すること。
  • 一般知識を保持したまま、知識グラフからドメイン固有の専門知識を習得する方法を開発すること。

提案手法

  • LLMが自然でユーザーフレンドリーな応答を生成するよう導くために、スタイル好みセットを構築する。
  • 取得した知識の三項対を用いて、選択的かつ正確な知識活用を可能にする知識好みセットを構築する。
  • スタイル好みと知識好みの両方を用いて、人間の好みにモデル生成を合わせる、新しい好みアライメント目的関数を設計する。
  • 取得した知識三項対を文脈として使用するだけでなく、好みセット構築の活性的要素としても統合する。
  • LLMを、知識信号と好み信号の両方で豊かにされたプロンプト上で訓練する、リtrieバル増強ファインチューニングパイプラインを採用する。
  • 応答品質(報酬モデリングを介して)と生成のなめらかさ(PPLを介して)を同時に最適化するための二重ブランチ損失目的関数を用いる。

実験結果

リサーチクエスチョン

  • RQ1LLMをどのように人間の好みにアライメントさせれば、ドメイン固有のQAにおいて信頼性が高くユーザーフレンドリーな回答を生成できるか?
  • RQ2取得した知識をどれだけ選択的に使用すれば、幻覚や不適切な内容を回避できるか?
  • RQ3統合された好みアライメントフレームワークは、LLMにおけるスタイルと知識活用の両面を効果的にバランスさせることができるか?
  • RQ4提案手法は、一般知識を保持しながら、どのようにドメイン固有の専門知識を習得するか?

主な発見

  • KnowPATはBLEU-1スコア22.56、ROUGE-1スコア20.28を達成し、最も強力なベースラインを著しく上回った。
  • アブレーションスタディの結果、特にファインチューニング、適応的重み付け、知識好みセットのいずれかを削除すると性能が低下した。
  • 一般知識の能力は強く維持されており、CMMLUベンチマークでは医学分野でわずかに低下し、経済分野でわずかに向上した。
  • ケーススタディでは、KnowPATは不要な取得知識(例:MACを口紅として認識)を正しく無視したのに対し、RRHFなどのベースラインはそれらにだまされた。
  • ゴールスタンダードのリファレンスと比較して、より情報量が多く自然な応答を生成した。例えば、アラームのホストパラメータを含むような回答が可能になった。
  • 報酬スコア-1.69は、人間の好みに強くアライメントしていることを示しており、-2.0未満のスコアを示すベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。