[논문 리뷰] Topics, Authors, and Institutions in Large Language Model Research: Trends from 17K arXiv Papers
이 연구는 2018–2023년 동안 16,979편의 LLM 관련 arXiv 논문을 분석하여 주제, 저자, 기관의 추세를 파악한다. 연구 결과, 사회적 영향 연구의 급격한 증가, 2023년에 50%에 이르는 신규 비-NLP 분야 저자 유입, 특히 구글을 포함한 기업의 출판 비중 감소, 그리고 미국/중국 기관 간의 분열과 낮은 해외 협력 수준이 드러났다. 이는 산업-학계 간 협력이 겹치는 주제에 집중하고 있음에도 불구하고, 주로 중복된 주제에 국한되어 있음을 시사한다.
Large language models (LLMs) are dramatically influencing AI research, spurring discussions on what has changed so far and how to shape the field's future. To clarify such questions, we analyze a new dataset of 16,979 LLM-related arXiv papers, focusing on recent trends in 2023 vs. 2018-2022. First, we study disciplinary shifts: LLM research increasingly considers societal impacts, evidenced by 20x growth in LLM submissions to the Computers and Society sub-arXiv. An influx of new authors -- half of all first authors in 2023 -- are entering from non-NLP fields of CS, driving disciplinary expansion. Second, we study industry and academic publishing trends. Surprisingly, industry accounts for a smaller publication share in 2023, largely due to reduced output from Google and other Big Tech companies; universities in Asia are publishing more. Third, we study institutional collaboration: while industry-academic collaborations are common, they tend to focus on the same topics that industry focuses on rather than bridging differences. The most prolific institutions are all US- or China-based, but there is very little cross-country collaboration. We discuss implications around (1) how to support the influx of new authors, (2) how industry trends may affect academics, and (3) possible effects of (the lack of) collaboration.
연구 동기 및 목표
- 2018년부터 2023년까지 LLM 연구 주제, 저자 배경, 기관의 역할 변화를 이해하기 위해
- 특히 컴퓨터 시각, 보안 등 분야에서 온 신규 저자들을 통해 NLP를 초월한 LLM 연구의 분야 확장을 분석하기 위해
- 특히 LLM 능력 향상과 기밀성 우려 증가에 대응하여 기업 및 학계의 출판 추세 변화를 평가하기 위해
- 협력 패턴을 분석하여, 특히 국경 간 및 산업-학계 협력의 특징을 조사하기 위해
- 이러한 추세가 향후 LLM 개발의 연구, 형평성, 협력에 미치는 영향을 평가하기 위해
제안 방법
- 2018년 1월부터 2023년 9월까지의 LLM 관련 arXiv 논문 16,979편을 메타데이터, 주제 레이블, 저자 소속, 인용 수를 기반으로 수집 및 분석하였다.
- 계층적 분류 체계를 사용하여 주제 레이블을 부여함으로써 주제의 인기 변화를 시간에 따라 추적할 수 있도록 하였다.
- 이전에 arXiv에서 NLP 논문의 공동 저자로 참여한 적이 없는 저자를 '신규 저자'로 정의하고, 그들의 sub-arXiv 및 주제 분포를 분석하였다.
- 기관, 국가, 부문(기업 대 학계)별 출판 비중을 추적하여 2023년의 추세에 집중하였다.
- 가장 활발한 20개 기관 간 협력 네트워크를 구축하여 지리적 및 부문별 군집화 여부를 평가하였다.
- 카이제곱 검정 등의 통계적 검정을 적용하여, 신규 저자와 경험이 많은 저자 간 주제 및 sub-arXiv 분포의 유의미한 차이를 확인하였다.
실험 결과
연구 질문
- RQ12018–2022년과 2023년 사이에 LLM 문헌의 주요 연구 주제가 어떻게 변화했는가. 특히 사회적 영향 및 비-NLP 응용 분야에서의 변화는 어떠한가?
- RQ22023년에 등장한 LLM 신규 저자 중 비-NLP 분야에서 온 비율은 얼마이며, 기존 저자와의 주제 선호도는 어떻게 다를까?
- RQ32023년에 산업계와 학계 기관의 출판 비중은 어떻게 변화했으며, 대규모 기술 기업의 출판 감소는 어떤 이유에서 비롯되었는가?
- RQ4산업-학계 협력은 분야나 지리적 갈등을 해소하는 데 얼마나 기여하는가, 아니면 기존의 주제 및 기관 군집을 강화하는가?
- RQ5기관 간 협력 패턴은 LLM 연구 분야에서 미국/중국 간 분열을 어떻게 반영하며, 글로벌 AI 발전에 어떤 영향을 미치는가?
주요 결과
- 컴퓨터 및 사회(sub-arXiv) 분야에서 2023년에 LLM 논문 제출 수가 20배 증가하여, 연구 분야가 사회적 영향 중심으로 크게 이동하고 있음을 시사한다.
- 2023년에 LLM 논문의 첫 번째 저자 중 49.5%, 마지막 저자 중 38.6%가 NLP 분야에 처음 참여한 것으로 나타났으며, 많은 이들이 컴퓨터 시각, 보안, 소프트웨어 공학 분야에서 유래하였다.
- 산업계의 LLM 논문 출판 비중은 2023년 이전의 19.3%에서 13.0%로 감소하였으며, 특히 구글의 출판 수가 크게 감소하여 기업의 개방성 감소 추세를 반영한다.
- 아시아의 학계 기관은 2023년에 출판 비중을 늘렸지만, 산업-학계 협력은 여전히 일반적이지만, 이미 기업이 우선시하는 주제 중심으로 편향되어 있다.
- 가장 활발한 20개 기관은 모두 미국 또는 중국에 소재해 있으며, 협력은 거의 전적으로 국내 내에서 이루어지며, 마이크로소프트만이 양 지역을 연결하는 유일한 주요 기관이다.
- 산업계와 학계가 공동으로 저술한 논문은 효율성 및 모델 성능과 같은 주제에 집중되어 있어, 사회적 또는 윤리적 문제에 대한 연구 우선순위 격차는 여전히 크다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.