[論文レビュー] Language Models as Agent Models
この論文は、言語モデル(LMs)が次単語予測の過程で信念、欲求、目的の近似表現を推論・利用することにより、意図の暗黙的モデルとして機能すると主張している。限定的な訓練データとエージェント状態への直接的なアクセスがなくても、LMsは共起的意図を模倣する能力を示し、一貫性があり目的志向の言語生成を可能にするが、誤った意図モデル化に起因する顕著な失敗モードを示している。
Language models (LMs) are trained on collections of documents, written by individual human agents to achieve specific goals in an outside world. During training, LMs have access only to text of these documents, with no direct evidence of the internal states of the agents that produced them -- a fact often used to argue that LMs are incapable of modeling goal-directed aspects of human language production and comprehension. Can LMs trained on text learn anything at all about the relationship between language and use? I argue that LMs are models of intentional communication in a specific, narrow sense. When performing next word prediction given a textual context, an LM can infer and represent properties of an agent likely to have produced that context. These representations can in turn influence subsequent LM generation in the same way that agents' communicative intentions influence their language. I survey findings from the recent literature showing that -- even in today's non-robust and error-prone models -- LMs infer and use representations of fine-grained communicative intentions and more abstract beliefs and goals. Despite the limited nature of their training data, they can thus serve as building blocks for systems that communicate and act intentionally.
研究の動機と目的
- テキストからのみ通信的意図を推論・表現できるかどうかを調査すること。これは、エージェントの精神状態への直接的アクセスが欠如している状況でも同様に成り立つ。
- これらの推定されたエージェント表現が言語生成にどのように影響を与えるかを検討すること。これは、人間の意図が会話の進行を導くのと同様のメカニズムを模倣する。
- 信念、欲求、意図の誤ったモデル化に起因する、言語モデルにおける失敗モードを特定・分析すること。
- テキストのみで事前学習された言語モデルが、より洗練されたエージェント風のシステムを構築するための土台(スキャフォールディング)としての可能性を検討すること。
- 言語モデルが善い意図と悪意のある意図の両方を模倣できる能力から生じる倫理的リスクを強調すること。
提案手法
- 論文は、LMの次単語予測を、エージェントの信念、欲求、意図の近似表現を推論・適用するプロセスとして分析する。
- 既存のNLP分野の実証的結果を援用し、LMがテキスト的文脈から微細な通信的意図や抽象的な目的を推定できることを示す。
- フレームワークは、LMの推論をエージェントシミュレーションの一種とみなす。内部で表現されるエージェント状態が、テキスト生成に因果的に影響を与える。
- GPT-3などの実際のモデルの事例研究を用いて、ナラティブや推論タスクにおいて、異なる信念や動機をLMがどのようにモデル化しているかを示す。
- 誤った推論が、文法的・意味的には正しいにもかかわらず、一貫性のないまたは矛盾する出力を引き起こす失敗事例を含む分析を行う。
- 今後のアーキテクチャは、テキストのみで事前学習されたものに基づき、エージェント状態の表現と推論をよりよく行えるように設計すべきだと提言する。
実験結果
リサーチクエスチョン
- RQ1言語モデルは、内部状態への直接的アクセスがなくとも、テキストのみからエージェントの通信的意図を推論・表現できるか?
- RQ2推定されたエージェント表現が、人間の発話が意図によって導かれるのと同様に、LMの言語生成にどの程度因果的に影響を与えるか?
- RQ3信念、欲求、意図の誤ったモデル化に起因する、現在のLMにおける失敗モードは何か?
- RQ4テキストのみで事前学習された言語モデルは、より強固で意図志向のシステムを構築するための土台としてどのように機能できるか?
- RQ5言語モデルが善い意図と悪意のある意図の両方を模倣できる能力に起因する倫理的リスクは何か?
主な発見
- 現在の言語モデルは、テキストのみで学習されていながらも、物理法則に関する異なる信念といった微細な通信的意図の表現を推定・利用できる。
- GPT-3のようなモデルは、落下する物体に関する異なる信念を予測する一貫性があり目的志向のナラティブを生成するなど、エージェント状態の暗黙的モデル化を示している。
- 言語生成における失敗は、文法的・意味的要因ではなく、主にエージェントの信念、欲求、意図に関する誤った推論に起因することが多い。
- 制限はあるものの、LMは、対立する動機や環境的制約を含むマルチエージェントシナリオの模倣能力を示す、顕著な発現的能力を有している。
- 信念・欲求・意図のモデル化の質は、リソースが限られた言語では著しく低下し、これらの能力の一般化が制限される。
- 改善された意図モデル化は、LMが有害または悪意あるエージェント行動を模倣するように誘導されるリスクを伴う可能性がある。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。