Skip to main content
QUICK REVIEW

[論文レビュー] In conversation with Artificial Intelligence: aligning language models with human values

Atoosa Kasirzadeh, Iason Gabriel|arXiv (Cornell University)|Sep 1, 2022
Ethics and Social Impacts of AI被引用数 15
ひとこと要約

本稿は、実用理論および発話行為理論に裏打ちされた理想対話規範を基盤として、会話型AIを人間の価値観に一致させる原則ベースのアプローチを提案する。グリスの法則と文脈に依存する規範を用いて、科学的、市民的、創造的コミュニケーションという分野固有の対話的理想を特定し、より真実性があり、敬意を払い、倫理的に整合性のある言語エージェントの設計のための枠組みを提示する。

ABSTRACT

Large-scale language technologies are increasingly used in various forms of communication with humans across different contexts. One particular use case for these technologies is conversational agents, which output natural language text in response to prompts and queries. This mode of engagement raises a number of social and ethical questions. For example, what does it mean to align conversational agents with human norms or values? Which norms or values should they be aligned with? And how can this be accomplished? In this paper, we propose a number of steps that help answer these questions. We start by developing a philosophical analysis of the building blocks of linguistic communication between conversational agents and human interlocutors. We then use this analysis to identify and formulate ideal norms of conversation that can govern successful linguistic communication between humans and conversational agents. Furthermore, we explore how these norms can be used to align conversational agents with human values across a range of different discursive domains. We conclude by discussing the practical implications of our proposal for the design of conversational agents that are aligned with these norms and values.

研究の動機と目的

  • 大規模言語モデルの会話型AIにおける倫理的・社会的課題に取り組むため、害の低減を超えて価値の一致に移行すること。
  • 成功した人間-AI対話の基盤となる言語的コミュニケーションの理想規範を特定し形式化すること。
  • 実用理論および発話行為理論に裏打ちされた原則ベースのアプローチを通じて、これらの規範を実装すること。
  • これらの規範が、科学的、市民的、創造的コミュニケーションという異なる対話的分野にどのように適合可能かを示すこと。
  • 対話的質と倫理的整合性に基づいて、会話型エージェントの評価と改善の基盤を提供すること。

提案手法

  • 会話型AIにおける人間-AI対話の構成要素としての発話行為と実用的規範に焦点を当てた哲学的・言語的分析を実施する。
  • 対話の質を評価・指導するためのコアフレームワークとして、グリスの法則(真実性、数量、関連性、形式)を適用する。
  • 科学的、市民的、創造的コミュニケーションの分野固有の対話的理想をマッピングし、それぞれの文脈に依存する規範を特定する。
  • 人間らしさを誇張する表現は、透明に正当化され、かつ幸福に整合している場合を除き、避けるべきであると提言する。
  • エージェントが対話の深まりを高めるために、前もって関連する文脈情報を提供する「文脈の構築と明確化」の概念を導入する。
  • 誤った権威や心的状態の帰属を避けるために、透明性と価値に配慮した設計を提唱する。

実験結果

リサーチクエスチョン

  • RQ1人間と会話型エージェントとの間で理想的な言語的コミュニケーションとは何か。そして、どのように形式化できるか。
  • RQ2グリスの法則のような実用的規範は、異なる会話的分野において言語モデルを人間の価値観に一致させるためにどのように適用可能か。
  • RQ3会話型エージェントは、人間らしさを誇張せずに、より敬意を払い、真実性があり、文脈的に適切な対話をどのように支援できるか。
  • RQ4有害な出力の欠如と、善い性質の高品質なコミュニケーションの存在とは、どのように区別できるか。
  • RQ5文脈の構築と明確化は、人間-AI対話の深さと整合性を向上させるために果たす役割は何か。

主な発見

  • 本稿は、真実性、関連性、明確性といった実用的規範に根ざした、分野固有の対話的理想に従うことが、理想的な会話型エージェントの必須条件であると特定している。
  • 有害な出力を排除するだけでは価値の一致に不十分であり、善い性質のコミュニケーションは、肯定的な規範の能動的育成を要するということが示された。
  • AIの出力における表現的・儀式的言語の使用は、不適切な人間らしさの誇張や権威の誤認を避けるために、慎重に評価されるべきである。
  • エージェントが文脈を前もって構築し、明確化することで、会話の質を高め、より深い対話的で敬意を示すやり取りを支援できる。
  • このフレームワークにより、反応的な害の緩和から、対話的に整合性があり、倫理的に整合性のあるAIシステムの能動的設計へのシフトが可能になる。
  • このアプローチは、対話的質と規範的整合性に基づいた、人間による評価および自動評価の両方の基盤を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。