Skip to main content
QUICK REVIEW

[論文レビュー] Unified Detoxifying and Debiasing in Language Generation via Inference-time Adaptive Optimization

Zonghan Yang, Xiaoyuan Yi|arXiv (Cornell University)|Oct 10, 2022
Fuzzy Logic and Control Systems被引用数 6
ひとこと要約

本稿では、推論時における適応的最適化を用いて、事前学習済み言語モデルにおける一括した毒性除去とバイアス除去を実現する統合的フレームワークUDDIAを提案する。パラメータ効率の良いチューニングを用いて、出力分布を同時に毒性と社会的バイアスの両面で是正することで、生成品質や計算コストへの影響を最小限に抑えつつ、優れた倫理的整合性を達成した。

ABSTRACT

Warning: this paper contains model outputs exhibiting offensiveness and biases. Recently pre-trained language models (PLMs) have prospered in various natural language generation (NLG) tasks due to their ability to generate fairly fluent text. Nevertheless, these models are observed to capture and reproduce harmful contents in training corpora, typically toxic language and social biases, raising severe moral issues. Prior works on ethical NLG tackle detoxifying and debiasing separately, which is problematic since we find debiased models still exhibit toxicity while detoxified ones even exacerbate social biases. To address such a challenge, we propose the first unified framework of detoxifying and debiasing called UDDIA, which jointly formalizes these two problems as rectifying the output space. We theoretically interpret our framework as learning a text distribution mixing weighted attributes. Besides, UDDIA conducts adaptive optimization of only a few parameters during decoding based on a parameter-efficient tuning schema without any training data. This leads to minimal generation quality loss and improved rectification performance with acceptable computational cost. Experimental results demonstrate that compared to several strong baselines, UDDIA achieves debiasing and detoxifying simultaneously and better balances efficiency and effectiveness, taking a further step towards practical ethical NLG.

研究の動機と目的

  • 分離された毒性除去とバイアス除去手法の限界に対処する。これらはしばしば一方の問題を悪化させながら他方を解消する傾向にある。
  • 推論時における事前学習済み言語モデルの毒性と社会的バイアスを同時に軽減する統合的フレームワークを構築する。
  • パラメータ効率の良いチューニングを用いて、生成品質の劣化を最小限に抑えつつ、低コストな計算を実現する。
  • 出力空間の同時是正を、属性に条件づけられたテキスト分布の混合として理論的に裏付けする。
  • 実用的な倫理的自然言語生成を実現する。効果性、効率性、および自然さのバランスをとる。

提案手法

  • UDDIAは、毒性とバイアスの両方を、感受性のある属性(例:性別、人種)や毒性への依存度を低減する出力分布の共同最適化として定式化する。
  • 外部分類器によって誘導される勾配ベースの更新を用いて、推論時に僅かなパラメータのみを微調整する適応的最適化を採用する。
  • 再訓練やトレーニングデータへのアクセスを必要とせず、LoRA風のパラメータ効率の良いチューニングスキームを用いる。
  • 是正プロセスを、人種グループや毒性属性に条件づけられたテキスト分布の混合として解釈することで理論的根拠を提供する。
  • 各生成ステップに対して適応的最適化を適用し、有害なコンテンツを低減しながら自然さを維持するように動的に出力を調整する。
  • 毒性とバイアスは外部ツールで測定される:毒性にはPERSPECTIVE API、バイアスにはRegardスコアが使用され、最適化プロセスをガイドする。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み言語モデルにおいて、毒性除去とバイアス除去を1つのフレームワークで統合的に効果的に実現できるか?
  • RQ2毒性とバイアスの両方を同時に最適化することで、分離手法よりも優れた性能が得られるか?
  • RQ3パラメータ効率の良い推論時適応によって、再訓練や顕著な品質損失なしに強力な倫理的整合性を達成できるか?
  • RQ4異なるモデルサイズにおいて、生成速度と自然さの観点から、本手法はどのように性能を発揮するか?
  • RQ5本フレームワークは、人種グループや性別グループ間の毒性ギャップとバイアスギャップを同時に縮小できるか?

主な発見

  • UDDIAは、DExperts や PPLM といった強力なベースラインを上回り、毒性低減とバイアス低減の両面で最先端の性能を達成した。
  • 本手法は、プロンプト全体で平均して40%の毒性低減を達成し、同時に人種グループ間のバイアスギャップも低減した。
  • 生成品質の損失は最小限であり、ペルフレックス(PPL)が元の GPT-2-Large モデルとほぼ同等であったため、自然さの維持が図られた。
  • UDDIA-t および UDDIA-u のバリエーションは PPLM よりも高速に推論されたが、一部のベースラインよりは遅く、最適化の余地が残っている。
  • 性別や人種グループ間の毒性ギャップは成功裏に縮小されたが、依然として残存ギャップが存在し、より細分化された属性を用いた改善の余地がある。
  • 本手法はさまざまなプロンプトタイプに対して頑健であるが、特定のプロンプトグループでは生成速度が低下し、一部の文脈でボトルネックが生じる可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。