Skip to main content
QUICK REVIEW

[論文レビュー] Automatically Neutralizing Subjective Bias in Text

Reid Pryzant, Richard Diehl Martinez|arXiv (Cornell University)|Nov 21, 2019
Topic Modeling参考文献 17被引用数 11
ひとこと要約

本論文は、主観的バイアスを自動的に中立化するという新しいタスクを紹介し、バイアスのある文をより客観的・中立的な表現に変換する手法を提案する。Wikipediaの編集履歴から得た18万組のバイアスあり/中立化済み文のペアを含む並列コーパスを構築し、モジュラーで解釈可能なモデルと、同時に動作するエンドツーエンドのモデルの2種類のsequence-to-sequenceモデルを提案。両モデルとも、ニュース、百科事典、書籍、政治演説の分野において人間による評価で優れた性能を示した。

ABSTRACT

Texts like news, encyclopedias, and some social media strive for objectivity. Yet bias in the form of inappropriate subjectivity - introducing attitudes via framing, presupposing truth, and casting doubt - remains ubiquitous. This kind of bias erodes our collective trust and fuels social conflict. To address this issue, we introduce a novel testbed for natural language generation: automatically bringing inappropriately subjective text into a neutral point of view ("neutralizing" biased text). We also offer the first parallel corpus of biased language. The corpus contains 180,000 sentence pairs and originates from Wikipedia edits that removed various framings, presuppositions, and attitudes from biased sentences. Last, we propose two strong encoder-decoder baselines for the task. A straightforward yet opaque CONCURRENT system uses a BERT encoder to identify subjective words as part of the generation process. An interpretable and controllable MODULAR algorithm separates these steps, using (1) a BERT-based classifier to identify problematic words and (2) a novel join embedding through which the classifier can edit the hidden states of the encoder. Large-scale human evaluation across four domains (encyclopedias, news headlines, books, and political speeches) suggests that these algorithms are a first step towards the automatic identification and reduction of bias.

研究の動機と目的

  • 新聞、百科事典、政治演説などの説明的テキストにおける不適切な主観的表現の広範な問題に対処すること。
  • 意味を保ちつつ、バイアスのある言語を中立的立場(NPOV)に変換することに焦点を当てた、自然言語生成の新しいタスクを開発すること。
  • 実際のWikipedia編集履歴に基づき、NPOVポリシーを適用した記録から得た、バイアスあり/中立化済みテキストペアの最初の並列コーパスを構築すること。
  • モジュラーで解釈可能なシステムと、同時に動作するエンドツーエンドのシステムの両方を提案・評価し、自動バイアス中立化のためのニューラルシーケンス・トゥ・シーケンス・モデルを構築すること。
  • 検出モジュールと生成モジュールを接続する学習可能なジョイン埋め込みを用いて、制御可能で透明性のあるデバイアス化を可能にすること。

提案手法

  • WikipediaのNPOVポリシーを適用した編集履歴から得た18万組のバイアスあり/中立化済み文ペアを含む、並列データセット「Wiki Neutrality Corpus(WNC)」を構築する。
  • モジュラーで2段階のモデルを設計:まず、BERTベースの分類器が主観的語(例:事実的動詞、バイアスを含む代名詞、フレーミング用語)を検出する。次に、新規のジョイン埋め込みが分類器の出力とエンコーダーの隠れ状態を統合し、編集を誘導する。
  • 同時でエンドツーエンドのモデルを実装:BERTエンコーダーを用いて、主観性の検出と中立化テキストの生成を同時に実行。重要度に応じたトークン重み付き損失関数を導入して、重要な編集に注目させる。
  • 両モデルをノイズ除去自己符号化の目的関数で学習し、WNCデータセット上で微調整することで、意味の保持を最優先にバイアスの除去を実現する。
  • ジョイン埋め込みを介して制御可能なメカニズムを導入:ユーザーがカスタムの確率分布を注入することで、モデルの検出を上書きし、特定の語の再表現を標的とする。
  • 4つの分野(百科事典、ニュース見出し、書籍、政治演説)における大規模な人間によるアノテーションを用いてモデルを評価し、文の自然さとバイアス低減の両面を測定する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルシーケンス・トゥ・シーケンス・モデルは、現実世界の説明的テキストにおける主観的バイアスを効果的に中立化できるか?
  • RQ2学習可能なジョイン埋め込みを備えたモジュラーで解釈可能なアーキテクチャは、同時に動作するエンドツーエンドのモデルと比較して、性能と制御性の面で優れているか?
  • RQ3提案されたモデルは、元の意味と文の自然さを保ちながら、どの程度バイアスを低減できるか?
  • RQ4ジョイン埋め込み機構を通じてユーザーが制御信号を注入することで、モデルが特定の語の編集を的確に制御できるか。また、そのような制御は人間の好みに適合するか?
  • RQ5提案されたモデルは、スタイル転送や機械翻訳分野の最先端手法と比較して、バイアス低減タスクにおいて優れているか?

主な発見

  • ジョイン埋め込みを備えたモジュラーモデルは、バイアス中立化タスクで93.52のBLEUと46.8%の精度を達成し、凍結されたBERT特徴を単純に連結したベースライン(90.78 BLEU、37.57%精度)を上回った。
  • 4つの分野にわたる人間による評価では、提案されたモデルが最先端のスタイル転送および機械翻訳システムよりも、より中立的かつ自然なテキストを生成した。
  • ジョイン埋め込み機構により、制御可能な編集が可能となった:ユーザーは特定の語を標的にして再表現を誘導でき、人間が関与するフィードバックによる出力の最適化が可能になった。
  • モジュラー・システムでは、ジョイン埋め込みを単純な連結に置き換えると性能が著しく低下し、検出と生成の間で学習された、エンドツーエンドの統合の重要性が示された。
  • Wiki Neutrality Corpus(WNC)には、18万組の文ペアが含まれており、エピステモロジカル、フレーミング、デモグラフィックなどのバイアスのサブカテゴリがアノテートされており、今後の研究のための貴重なベンチマークを提供している。
  • 強力な性能を示したものの、モデルは単語1語の編集に限定されており、データセット全体の編集の約25%にとどまっていることから、多語にわたる編集や文間バイアスの処理にはさらなる改善の余地がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。