[論文レビュー] What Do NLP Researchers Believe? Results of the NLP Community Metasurvey
この論文は、2022年5月から6月にかけて実施されたNLPコミュニティメタサーベイの調査結果を提示している。この大規模なサーベイは、スケーリング、AGI、言語構造、倫理といった論争の生じる問題についての研究者の明示的信念(例えば、スケーリングの役割、AGI、言語構造、倫理)と、コミュニティの見解に関する社会的信念を評価している。主な結果として、実際の信念と認識された共通見解との間で顕著な不一致が明らかになった。特に、ベンチマークの有用性についての信念が過大評価されており、また、学際的科学やインダクティブバイアスへの支持が低く評価されている。
We present the results of the NLP Community Metasurvey. Run from May to June 2022, the survey elicited opinions on controversial issues, including industry influence in the field, concerns about AGI, and ethics. Our results put concrete numbers to several controversies: For example, respondents are split almost exactly in half on questions about the importance of artificial general intelligence, whether language models understand language, and the necessity of linguistic structure and inductive bias for solving NLP problems. In addition, the survey posed meta-questions, asking respondents to predict the distribution of survey responses. This allows us not only to gain insight on the spectrum of beliefs held by NLP researchers, but also to uncover false sociological beliefs where the community's predictions don't match reality. We find such mismatches on a wide range of issues. Among other results, the community greatly overestimates its own belief in the usefulness of benchmarks and the potential for scaling to solve real-world problems, while underestimating its own belief in the importance of linguistic structure, inductive bias, and interdisciplinary science.
研究の動機と目的
- NLP分野における論争の生じる問題について、研究者の信念のスペクトルを実証的にマップすること。
- 研究者の実際の信念と、コミュニティの見解に関する社会的信念との間のギャップを調査すること。
- NLP研究におけるコミュニケーション、協働、共通見解形成を妨げる可能性がある誤った社会的信念を同定すること。
- 特に倫理、AGI、およびメソドロジーや優先順位に関する現実との整合性を踏まえた、分野の自己認識に関するデータ駆動型の知見を提供すること。
提案手法
- 2022年5月から6月にかけて、NLP研究者コミュニティの480名を対象にウェブベースのサーベイを実施した。
- 各論争の問題について、被験者はある立場(例:スケーリングやAGIに関する立場)にどの程度賛同するかを表明し、また、他の研究者がその立場に賛同する割合を予測した。
- 実際の回答と予測された回答の乖離を用いて、誤った社会的信念を同定した。
- AGI、言語構造、インダクティブバイアス、ベンチマーキング、学際的統合といった、文献で活発な議論が行われている問題に焦点を当てた。
- サンプリングバイアスの可能性を評価するため、人口統計的および機関的代表性に関するデータを収集した。
- 記述統計および実際の回答分布と予測された回答分布の比較を用いて、結果を分析した。
実験結果
リサーチクエスチョン
- RQ1スケーリング、AGI、言語構造といった主要な論争の生じる問題について、NLP研究者の間で実際にどのような信念の分布が存在するのか。
- RQ2NLP研究者が、他の研究者の信念の広がりをどの程度正確に予測できているか。
- RQ3研究者の社会的信念が、コミュニティ内の意見の実際の分布からどの程度乖離しているか。
- RQ4NLP研究の科学的価値と社会的影響に関する研究者の信念は、コミュニティの共通見解に対する認識と比べてどう異なるか。
- RQ5社会的信念の不一致が、NLP分野におけるコミュニケーション、協働、研究方針にどのような影響を及えるか。
主な発見
- NLP研究者の大多数は、現在のシステムをスケーリングすることで、実用的に重要なNLP問題を解決できるという仮説に反対しているが、実際にはそれほど広く支持されているとは限らないにもかかわらず、そのように信じている。
- 被験者は、ベンチマークやスケーリングが実世界の問題解決にどれほど価値があるかを著しく過大評価している。
- 学際的知見の重要性を信じているにもかかわらず、同様の見解を持つ同僚の数を著しく低估している。
- 大多数の被験者は、NLP研究の大多数に科学的価値がないと考えており、分野の現在の方向性に対する批判的自己評価を示している。
- NLPの将来的な社会的影響については強い楽観主義が見られ、多くの研究者が変革的あるいは危険な結果を予測している。
- 言語モデルが言語を理解しているかどうか、言語構造の必要性、インダクティブバイアスの重要性といった、核となる問いについては、コミュニティはほぼ均等に分かれている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。