[논문 리뷰] Whose Language Counts as High Quality? Measuring Language Ideologies in Text Data Selection
이 논문은 대규모 언어 모델의 훈련 데이터를 선별하는 데 사용되는 자동 텍스트 품질 필터에 내재된 언어 이데올로기에 대해 조사한다. 미국 고등학교 신문 기사의 국가적 데이터셋에 GPT-3 품질 필터를 적용한 결과, 특히 도시 지역에 위치한 더 크고 부유하며 더 높은 교육 수준을 가진 학교에서 온 텍스트들이 체계적으로 유리하게 평가됨을 발견하여, 사실적 정확성이나 문학적 품질과는 무관하게 주류의 권위 있는 언어 규범을 우선시하는 편향이 드러났다.
Language models increasingly rely on massive web dumps for diverse text data. However, these sources are rife with undesirable content. As such, resources like Wikipedia, books, and newswire often serve as anchors for automatically selecting web text most suitable for language modeling, a process typically referred to as quality filtering. Using a new dataset of U.S. high school newspaper articles -- written by students from across the country -- we investigate whose language is preferred by the quality filter used for GPT-3. We find that newspapers from larger schools, located in wealthier, educated, and urban ZIP codes are more likely to be classified as high quality. We then demonstrate that the filter's measurement of quality is unaligned with other sensible metrics, such as factuality or literary acclaim. We argue that privileging any corpus as high quality entails a language ideology, and more care is needed to construct training corpora for language models, with better transparency and justification for the inclusion or exclusion of various texts.
연구 동기 및 목표
- 자동 품질 필터가 대규모 언어 모델 훈련에 사용될 때 어떤 언어적 및 인구통계적 특성이 우선시되는지 조사하기.
- GPT-3에서 사용된 품질 필터가 사실성, 문학적 평판, 또는 교육 수준과 같은 객관적 품질 지표와 일치하는지 평가하기.
- 일반적으로 중립적 또는 기술적이라고 간주되는 데이터 선별 과정에 암묵적으로 내재된 언어 이데올로지를 드러내기.
- 편향된 필터링 기준으로 인해 자연어 처리 코퍼스에서 소수자 공동체의 목소리가 체계적으로 배제되는 방식을 강조하기.
- 자연어 처리 연구에서 데이터 선별 절차에 대한 투명성 향상, 의도적인 코딩, 문서화를 촉구하기.
제안 방법
- 다양한 지리적 및 사회경제적 배경을 가진 1,000건의 미국 고등학교 신문 기사로 구성된 신규 데이터셋을 활용해 GPT-3 품질 필터를 재현하기.
- 저자 소속 지역의 인구 및 사회경제적 지표를 연결하기 위해 신문 데이터셋에 미국 합계 및 교육통계국 데이터를 통합하기.
- 각 기사가 GPT-3 필터에 의해 '고품질'로 분류될지를 예측하기 위해 텍스트 분류 모델을 훈련하고 적용하기.
- 문장 복잡성, 어휘 다양성, 주제 일관성과 같은 특정 언어적 및 스타일적 특성에 대한 필터의 선호도 측정하기.
- 외부 기준과 비교: 뉴스 기사의 사실성 평가 점수, 표준화된 시험 성취도, 문학상 수상 여부.
- 사회언어학적 분석을 통해 필터 결과와 학교 규모, 우편번호 소득 수준, 교육 수준, 도시화 수준 등의 인구통계적 변수 간의 관계 분석하기.
실험 결과
연구 질문
- RQ1GPT-3 품질 필터는 어떤 유형의 학생 작성 텍스트를 더 높은 품질로 분류하는가?
- RQ2이 필터의 품질 평가가 사실성 또는 문학적 우수성과 같은 객관적 지표와 어느 정도 상관이 있는가?
- RQ3저자 소속 공동체의 인구통계적 및 사회경제적 요소가 필터의 품질 예측과 어떻게 관련이 있는가?
- RQ4자동 텍스트 필터링 과정에 내재된 언어 이데올로지는 무엇이며, 이를 통해 어떤 언어 규범이 다른 것들보다 유리하게 평가되는가?
- RQ5이러한 데이터 선별의 편향이 후속 자연어 처리 시스템에서 체계적 불평등을 어떻게 초래하는가?
주요 결과
- GPT-3 품질 필터는 부유하고 교육 수준이 높으며 도시 지역에 위치한 더 큰 학교에서 온 기사들을 비례적으로 유리하게 평가한다.
- 고소득, 고교육 수준, 도시 지역에 위치한 학교에서 온 기사들은 언어적 복잡성 조절 후에도 고품질로 분류될 가능성이 뚜렷하게 높았다.
- 필터는 뉴스 기사의 사실성 평가와 의미 있는 상관관계를 보이지 않아 사실성 신뢰성은 우선시하지 않는 것으로 나타났다.
- 문학적 평판이나 표준화된 시험 성취도와도 일치하지 않아, 이 필터가 객관적 기반 없는 품질 개념을 측정하고 있음을 시사한다.
- 필터의 선호도는 표준적이고 형식적이며 학술적인 글쓰기를 우선시하는 언어 이데올로지를 반영하고 있으며, 다른 타당한 언어 양식은 배제한다.
- 결과적으로 데이터 코딩이 중립적인 과정이 아니며, 언어 이데올로지가 대규모 언어 모델에 포함되거나 배제되는 목소리에 영향을 미친다는 점을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.