[論文レビュー] Do Neural Language Representations Learn Physical Commonsense?
この論文は、BERTのような最先端のニューラル言語モデルが、文脈的および視覚的文脈から物体の機能的特性や性質を推論する能力をもって物理的日常的推論を学習しているかどうかを調査する。性質および機能の予測において優れたパフォーマンスを示すが、性質と機能の間の論理的関係については推論に失敗しており、因果的物理的理解ではなく表面的関連性に依存していることが示唆される。
Humans understand language based on the rich background knowledge about how the physical world works, which in turn allows us to reason about the physical world through language. In addition to the properties of objects (e.g., boats require fuel) and their affordances, i.e., the actions that are applicable to them (e.g., boats can be driven), we can also reason about if-then inferences between what properties of objects imply the kind of actions that are applicable to them (e.g., that if we can drive something then it likely requires fuel). In this paper, we investigate the extent to which state-of-the-art neural language representations, trained on a vast amount of natural language text, demonstrate physical commonsense reasoning. While recent advancements of neural language models have demonstrated strong performance on various types of natural language inference tasks, our study based on a dataset of over 200k newly collected annotations suggests that neural language representations still only learn associations that are explicitly written down.
研究の動機と目的
- ニューラル表現が物理的日常的知識、特に物体の性質とそれらの機能に関する推論を学習しているかどうかを評価すること。
- 言語モデルが、物体の性質とそれらに適用可能な行動の間の因果的または論理的関係(例:走行可能な物体には燃料が必要)を推論できるかどうかを調査すること。
- 物理的日常的推論をベンチマーク化するため、物体の性質、機能、およびそれらの相互関係をアノテートした2つの新しいデータセット(抽象的および状況依存的)を構築し、公開すること。
- BERT や ELMo などの現代的な文脈依存モデルが、表面的統計的関連性を越えて物理的日常的推論を推論できるかどうかを評価すること。
提案手法
- McRateデータセットの洗練版を基に、20万件を超えるアノテーションを含む新しい抽象的データセットを構築。密度の高いラベル付けと偽陰性の低減を実現。
- MS COCOの画像を用いて、特定の物体インスタンスに対して性質と機能をアノテートした状況依存データセットを構築。曖昧な「判断不能」の回答を排除。
- 動詞ベースのインターフェースを用いて機能のアノテーションを収集。各物体に対して上位3つの動詞を選択し、選択されなかった動詞からネガティブサンプルを生成。
- Amazon Mechanical Turkを用い、偽性質(例:「Xは英語の単語ですか?」)を用いた品質管理により、ランダムなアノテーターをフィルタリング。
- モデル固定のベースラインよりも性能を向上させるために、BERTをデータセット上でエンドツーエンドで微調整。
- 3つのタスクでモデルを評価:物体-性質(O↔P)、物体-機能(O↔A)、機能-性質(A↔P)の予測。
実験結果
リサーチクエスチョン
- RQ1ニューラル言語モデルは、性質から機能を推論できるか(A←P)? 例:船は走行可能であるため、燃料が必要だと推論できるか?
- RQ2モデルは、機能から性質を推論できるか(A→P)? 例:電気を必要とする物体は、プラグに差さなければならないと認識できるか?
- RQ3モデルは、性質と機能の間の論理的または因果的関係を学習しているのか、それとも表面的共起性のみを記憶しているのか?
- RQ4文脈依存モデル(例:BERT)は、静的埋め込み(例:GloVe)と比較して、物理的日常的推論知識をよりよく捉えられるか?
- RQ5画像への視覚的根拠付けは、純粋にテキスト入力よりも物理的日常的推論の能力を向上させるか?
主な発見
- BERT や他のニューラル言語モデルは、文脈からの物体の性質および機能の予測において優れたパフォーランスを示しており、表面的関連性を学習していることが示唆される。
- O↔P および O↔A タスクでは高い正確性を示すが、A↔P 推論タスクでは著しく低いパフォーランスを示しており、性質と機能の間の論理的または因果的関係を学習していないことが示唆される。
- 最高性能を示したモデル(微調整済みBERT)でさえ、A↔P タスクにおいて人間の水準の推論を著しく下回っており、人間の基準と比べて顕著に低いパフォーマンスを示している。
- 実画像に根拠を持つ状況依存データセットは、アノテーション品質を向上させ、特に機能予測の信頼性ある評価を可能にした。
- データ収集における偽性質の使用は、低品質なアノテーターを効果的にフィルタリングし、データセットの信頼性を向上させた。
- エンドツーエンドの微調整を行った後でも、BERT はパターンマッチングを超えて物理的日常的推論を学習していないことが示され、現在の自己教師あり言語表現学習における根本的な限界を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。