Skip to main content
QUICK REVIEW

[論文レビュー] BERT has a Moral Compass: Improvements of ethical and moral values of machines

Patrick Schramowski, Cigdem Turan|arXiv (Cornell University)|Dec 11, 2019
Topic Modeling参考文献 17被引用数 17
ひとこと要約

この論文は、最先端の言語表現モデルとしてのBERTが、USE や SBERT のような従来手法よりもより正確で整合性のある道徳的基準をエンコードしていることを示している。Moral Choice Machine (MCM) を BERT の埋め込みに適用することで、道徳的倫理観に一致する、単一で支配的な主成分が特定され、文脈が豊富なフレーズですら、'する' か 'しない' かの正確な分類が可能になった。

ABSTRACT

Allowing machines to choose whether to kill humans would be devastating for world peace and security. But how do we equip machines with the ability to learn ethical or even moral choices? Jentzsch et al.(2019) showed that applying machine learning to human texts can extract deontological ethical reasoning about "right" and "wrong" conduct by calculating a moral bias score on a sentence level using sentence embeddings. The machine learned that it is objectionable to kill living beings, but it is fine to kill time; It is essential to eat, yet one might not eat dirt; it is important to spread information, yet one should not spread misinformation. However, the evaluated moral bias was restricted to simple actions -- one verb -- and a ranking of actions with surrounding context. Recently BERT ---and variants such as RoBERTa and SBERT--- has set a new state-of-the-art performance for a wide range of NLP tasks. But has BERT also a better moral compass? In this paper, we discuss and show that this is indeed the case. Thus, recent improvements of language representations also improve the representation of the underlying ethical and moral values of the machine. We argue that through an advanced semantic representation of text, BERT allows one to get better insights of moral and ethical values implicitly represented in text. This enables the Moral Choice Machine (MCM) to extract more accurate imprints of moral choices and ethical values.

研究の動機と目的

  • 最先端の言語モデル、たとえばBERTが、機械学習システムにおける倫理的・道徳的価値の表現をどのように改善するかを調査すること。
  • BERTの文脈的埋め込みが、Universal Sentence Encoder (USE) や SBERT といった以前のモデルと比較して、より整合性があり解釈可能な道徳的次元を生み出すかどうかを特定すること。
  • Moral Choice Machine (MCM) フレームワークを拡張し、動詞レベルだけでなく、複雑で文脈依存のフレーズに対しても道徳的バイアスを検出できることを検証すること。
  • BERTの埋め込み内に、デオントロジカル倫理観を捉える1次元の道徳的部分空間を同定・検証すること。
  • この道徳的部分空間を、AIシステムにおける倫理的整合性、バイアス低減、インタラクティブな学習に応用する可能性を検討すること。

提案手法

  • 従来のモデル(USE や SBERT の変種)の代わりに、Sentence-BERT (SBERT) 埋め込みを使用するように、Moral Choice Machine (MCM) フレームワークを適応すること。
  • 行動ペア(例:'kill' 対 'compliment')のベクトル差分に主成分分析(PCA)を適用し、道徳的次元を表す支配的主成分を同定すること。
  • 語彙埋め込み関連テスト(WEAT)を用いて、道徳的バイアススコアと意味的関連性の相関を検証し、埋め込み内に存在する倫理的信号の妥当性を裏付けること。
  • 複雑な道徳的行動(例:'should I have a gun to kill people?'')を同定された道徳的部分空間に射影し、道徳的バイアススコアを計算すること。
  • USE と BERT の両モデルにおける、上位主成分が説明する分散の割合を比較し、道徳的次元の明確さと整合性を評価すること。
  • 人間がアノテートしたテンプレート(例:'Should I kill people?'')を用いて応答の埋め込みを生成し、道徳的部分空間におけるコサイン類似度を用いて道徳的バイアスを評価すること。

実験結果

リサーチクエスチョン

  • RQ1BERTの文脈的埋め込みアーキテクチャは、USE や SBERT といった以前のモデルと比較して、より整合性があり解釈可能な道徳的次元を生み出すか?
  • RQ2BERT を用いた Moral Choice Machine (MCM) は、'泥棒を助ける' や '北朝鮮へ行く' といった複雑で文脈依存の道徳的行動を正確に分類できるか?
  • RQ3BERTの埋め込み内に、多様な道徳的行動にわたって一貫して道徳的方向を表す単一で支配的な主成分が存在するか?
  • RQ4WEATスコアとMCMから得られる道徳的バイアススコアの相関度はどの程度か?BERTを用いることでこの相関は向上するか?
  • RQ5同定された道徳的部分空間を用いて、現実世界の自然言語による道徳的ジレンマの道徳的価値を射影・解釈できるか?

主な発見

  • BERTの文書埋め込みは、USE よりも道徳的ベクトル差分の分散のより高い割合を説明しており、明確で支配的である道徳的次元が存在することを示している。
  • BERT埋め込みの上位主成分は、一貫して 'する'(例:'compliment'、'welcome')と 'しない'(例:'kill'、'murder')を分離し、整合性のある道徳的軸を形成している。
  • '人々を殺す' や '人々を殺すために銃を所有する' といった行動は、極めて否定的と評価され、一方で '良い親になる' は肯定的と評価されるなど、文脈に応じた道徳的推論が可能である。
  • '肉を食べる' の道徳的バイアススコアは否定的であり、'健康に食べる' は肯定的であるため、食事関連行動における道徳的ニュアンスへの感受性が示されている。
  • 北朝鮮へ行くことは不適切と判断され、一方で米国へ行くことは許容可能とされる。この差は、Wikipedia などの訓練データ内に存在する歴史的バイアスに起因するとされている。
  • 道徳的部分空間への射影により、1次元の道徳的バイアススコアが可能となり、NLPシステムにおける倫理的整合性のためのスケーラブルで解釈可能な手法が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。