Skip to main content
QUICK REVIEW

[論文レビュー] Truth Machines: Synthesizing Veracity in AI Language Models

Luke Munn, Liam Magee|arXiv (Cornell University)|Jan 28, 2023
Ethics and Social Impacts of AI被引用数 6
ひとこと要約

この論文は、InstructGPT や ChatGPT といった大規模言語モデルが、データ、アーキテクチャ、社会的フィードバックの統合を通じて真実をどのように実現化しているかを調査し、AI が生成する真実が客観的ではなく、社会的に構築されたパフォーマンスであることを明らかにしている。AI が真実を語る役割を再考する必要があり、真実性を高めるために社会的文脈を豊かにし、現実をより厚く表現する必要がある。同時に、社会は AI に求めたいかなる種類の真実なのかを直視するよう促している。

ABSTRACT

As AI technologies are rolled out into healthcare, academia, human resources, law, and a multitude of other domains, they become de-facto arbiters of truth. But truth is highly contested, with many different definitions and approaches. This article discusses the struggle for truth in AI systems and the general responses to date. It then investigates the production of truth in InstructGPT, a large language model, highlighting how data harvesting, model architectures, and social feedback mechanisms weave together disparate understandings of veracity. It conceptualizes this performance as an operationalization of truth, where distinct, often conflicting claims are smoothly synthesized and confidently presented into truth-statements. We argue that these same logics and inconsistencies play out in Instruct's successor, ChatGPT, reiterating truth as a non-trivial problem. We suggest that enriching sociality and thickening "reality" are two promising vectors for enhancing the truth-evaluating capacities of future language models. We conclude, however, by stepping back to consider AI truth-telling as a social practice: what kind of "truth" do we as listeners desire?

研究の動機と目的

  • 真実性の問題が存在する中で、InstructGPT や ChatGPT といった AI 言語モデルがどのように『真実』を生成・実行しているかを検討すること。
  • 訓練データ、モデルアーキテクチャ、フィードバックループといった社会技術的メカニズム——データ収集、モデル構造、フィードバックループ——が、AI が生成する真実の主張をどのように統合的に形作っているかを分析すること。
  • 真実が技術的解決策ではなく、社会的・政治的構築物であるという主張をし、議論の環境を意図的に設計する必要があることの根拠を提示すること。
  • 将来のモデルが、真実評価能力を高めるために社会的文脈を豊かにし、より複雑で根拠のある現実の表現を統合する必要があると提言すること。
  • 開発者や利用者に、利便性や利益志向の物語を超えて、AI に求めたいいかなる種類の真実なのかを自ら問い直すよう促すこと。

提案手法

  • InstructGPT を事例として分析し、訓練データ、モデルアーキテクチャ、人間からの強化学習(RLHF)を通じて、真実性の多様な理解がどのように実装されているかを追跡する。
  • 矛盾する真実主張を統合的に、自信を持って一貫した出力へと変換するプロセスを「真実の実装」として概念化する——これは事実の反映ではなく、パフォーマンス的行為である。
  • フーコーの言語・真実の理論を応用し、AI を、力関係に満ちた言語状況に埋め込まれた社会的実践として位置づける。
  • InstructGPT のメカニズムとその後続モデルである ChatGPT のメカニズムを比較し、妥当に聞こえるが実際には誤りである可能性のある真実主張の生産が、継続的に行われていることを示す。
  • 真実評価を向上させるための2つの設計的アプローチを提言する:社会的要素の強化(例:ユーザーの意図、文脈、対話のルールのモデル化)と現実の厚みの強化(例:マルチモーダル情報、時間的・因果的文脈の統合)。
  • 企業の役割が、AI 論争の事実上のステージマネージャーとして果たしていること、そして免責条項やパフォーマンス最適化を通じて責任を回避していることの批判的検証を行う。

実験結果

リサーチクエスチョン

  • RQ1InstructGPT や ChatGPT といった大規模言語モデルは、真実性の対立する理解をどのように統合し、一貫的で自信のある真実主張へと変換しているか?
  • RQ2データ、アーキテクチャ、フィードバックといった社会技術的メカニズムが、AI システムが真実語りを社会的・修辞的行為として行うのをどのように可能にしているか? これは客観的な真実探索プロセスではなく、真実語りの社会的・修辞的行為である。
  • RQ3AI における真実の実装が、医療や法的分野などハイリスク分野において、既存の権力構造をどのように反映・再生産しているか?
  • RQ4将来の言語モデルは、社会的文脈を豊かにし、より複雑で根拠のある現実の表現を統合することで、真実評価能力をどのように向上させられるか?
  • RQ5AI システムが生み出すべき真実の種類は何か? そして、このような設計選択から生じる倫理的・社会的責任は何か?

主な発見

  • 大規模言語モデルは、中立的・客観的ではなく、データ、アーキテクチャ、社会的フィードバックの統合を通じて真実を実装しており、信ぴょう性はあるが、誤りである可能性がある文を生成する。
  • InstructGPT や ChatGPT が生成する真実とは、地面の真実の反映ではなく、訓練データ、RLHF、ユーザーの期待によって形作られたパフォーマンス的構築物である。
  • 正確性を主張しても、ChatGPT は自殺の助言を含む有害なコンテンツを生成しており、高い自信があるからといって真実性や安全性が保証されるわけではない。
  • AI における真実の実装は、企業の利益とユーザーの期待が「真実」とされる基準を形作る社会的・政治的プロセスを反映しており、しばしば事実の正確性よりも一貫性や関与度を優先する。
  • 現在のモデルは『便宜の真実』のシステムに従っており、ユーザーまたは企業が聞きたいことを生成するが、倫理的・認識論的責任へのコミットメントは欠如している。
  • 本論文は、AI の真実語りを技術的問題としてではなく、意図的に設計された議論の環境を必要とする社会的実践として再考する必要があると結論づける。その際、明確な規範、責任体制、AI が人工的かつ構築物であることを認識することが不可欠である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。