[논문 리뷰] What Do NLP Researchers Believe? Results of the NLP Community Metasurvey
이 논문은 2022년 5월~6월에 실시된 NLP 커뮤니티 메타설문 조사의 결과를 제시한다. 이는 NLP 연구자들에 대한 대규모 설문 조사로, 스케일링, AGI, 언어적 구조, 윤리 등 논란이 되는 주제들에 대한 연구자들의 명시적 신념과 커뮤니티의 견해에 대한 사회학적 신념을 평가한다. 주요 결과는 실제 신념과 공감대에 대한 인식 간 괴리가 뚜렷하다는 점을 보여주며, 특히 벤치마크 유용성에 대한 신념을 과도하게 평가하고, 다학제적 과학 및 인덕티브 편향에 대한 지지 수준을 낮게 평가하고 있음을 확인한다.
We present the results of the NLP Community Metasurvey. Run from May to June 2022, the survey elicited opinions on controversial issues, including industry influence in the field, concerns about AGI, and ethics. Our results put concrete numbers to several controversies: For example, respondents are split almost exactly in half on questions about the importance of artificial general intelligence, whether language models understand language, and the necessity of linguistic structure and inductive bias for solving NLP problems. In addition, the survey posed meta-questions, asking respondents to predict the distribution of survey responses. This allows us not only to gain insight on the spectrum of beliefs held by NLP researchers, but also to uncover false sociological beliefs where the community's predictions don't match reality. We find such mismatches on a wide range of issues. Among other results, the community greatly overestimates its own belief in the usefulness of benchmarks and the potential for scaling to solve real-world problems, while underestimating its own belief in the importance of linguistic structure, inductive bias, and interdisciplinary science.
연구 동기 및 목표
- NLP 분야의 논란이 되는 주제들에 대해 연구자들 간의 신념 스펙트럼을 실증적으로 맵핑하는 것.
- 연구자들의 실제 신념과 커뮤니티 견해에 대한 사회학적 신념 간 격차를 조사하는 것.
- 소통, 협업 및 공감대 형성에 장애가 될 수 있는 잘못된 사회학적 신념을 특정하는 것.
- 윤리, AGI 및 방법론적 우선순위에 대해 분야의 자가 인식이 현실과 얼마나 일치하는지에 대한 데이터 기반 통찰을 제공하는 것.
제안 방법
- 2022년 5월부터 6월까지 NLP 연구자들 대상으로 웹 기반 설문 조사를 실시하여 총 480명의 응답을 확보.
- 각 논란이 되는 주제에 대해 응답자는 특정 입장(예: 스케일링 또는 AGI에 대한 동의)에 대한 자신의 동의 수준과 동시에 다른 연구자들이 이에 동의할 비율을 예측.
- 실제 응답과 예측 응답 간 격차를 분석하여 잘못된 사회학적 신념을 규명.
- AGI, 언어적 구조, 인덕티브 편향, 벤치마킹, 다학제 통합 등 문헌에서 활발히 논의되고 있는 주제에 집중.
- 표본 편향 가능성을 평가하기 위해 인구통계학적 및 소속 기관 정보를 수집.
- 기술통계 및 실제 응답 분포와 예측 응답 분포 간 비교를 통해 결과를 분석.
실험 결과
연구 질문
- RQ1스케일링, AGI, 언어적 구조와 같은 핵심 논란 주제들에 대해 NLP 연구자들 간 실제 신념 분포는 어떻게 되는가?
- RQ2NLP 연구자들은 이 주제들에 대해 다른 연구자들의 신념 분포를 얼마나 정확하게 예측하는가?
- RQ3연구자들의 사회학적 신념은 커뮤니티 내 실제 의견 분포와 얼마나 다를까?
- RQ4NLP 연구의 과학적 가치와 사회적 영향에 대한 연구자들의 신념은 커뮤니티 공감대에 대한 그들의 인식과 어떻게 다를까?
- RQ5일치하지 않는 사회학적 신념이 NLP 연구의 소통, 협업 및 연구 방향 설정에 어떤 영향을 미칠까?
주요 결과
- 대부분의 NLP 연구자들이 현재 시스템의 스케일링이 실질적으로 중요한 NLP 문제를 해결할 수 있다는 가설에 반대하지만, 실제로는 이 견해가 더 널리 퍼져 있다고 오해하고 있다.
- 연구자들은 커뮤니티가 벤치마크와 스케일링이 실제 문제 해결에 얼마나 중요한지 평가하는 데에 과도하게 높은 가치를 부여하고 있다.
- 다학제적 통찰의 중요성을 믿고 있음에도 불구하고, 연구자들은 이를 공감하는 동료 수를 상당히 과소평가하고 있다.
- 대부분의 응답자가 대부분의 NLP 연구의 과학적 가치에 의문을 제기하고 있어, 분야의 현재 방향성에 대해 비판적인 자기 평가를 하고 있음을 보여준다.
- NLP의 미래 사회적 영향에 대해 강한 낙관이 존재하며, 다수의 연구자들이 변혁적 또는 심지어 위험한 결과를 예측하고 있다.
- 언어 모델이 언어를 이해하는지, 언어적 구조가 필수적인지, 인덕티브 편향이 중요한지와 같은 핵심 질문들에 대해 커뮤니티는 거의 균형을 이루고 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.