Skip to main content
QUICK REVIEW

[논문 리뷰] What to do about non-standard (or non-canonical) language in NLP

Barbara Plank|arXiv (Cornell University)|2016. 08. 28.
Natural Language Processing Techniques참고 문헌 26인용 수 18
한 줄 요약

이 논문은 NLP 모델이 뉴스기사와 같은 편향되고 균일한 데이터로 훈련되면서 비표준 언어에 대해 성능 저하를 겪는다고 주장한다. 이를 해결하기 위해 현재는 활용되지 않는 다양한 실제 텍스트인 '운명적 데이터(fortuitous data)'를 활용하고, 강력한 알고리즘과 결합하여 더 유연하고 다양한 언어적 변형을 고려하는 모델을 구축할 것을 제안한다. 이는 언어적 다양성에 걸쳐 일반화하는 데 더 강력한 모델을 만드는 데 기여한다.

ABSTRACT

Real world data differs radically from the benchmark corpora we use in natural language processing (NLP). As soon as we apply our technologies to the real world, performance drops. The reason for this problem is obvious: NLP models are trained on samples from a limited set of canonical varieties that are considered standard, most prominently English newswire. However, there are many dimensions, e.g., socio-demographics, language, genre, sentence type, etc. on which texts can differ from the standard. The solution is not obvious: we cannot control for all factors, and it is not clear how to best go beyond the current practice of training on homogeneous data from a single domain and language. In this paper, I review the notion of canonicity, and how it shapes our community's approach to language. I argue for leveraging what I call fortuitous data, i.e., non-obvious data that is hitherto neglected, hidden in plain sight, or raw data that needs to be refined. If we embrace the variety of this heterogeneous data by combining it with proper algorithms, we will not only produce more robust models, but will also enable adaptive language technology capable of addressing natural language variation.

연구 동기 및 목표

  • 비표준 언어 양식에 적용했을 때 NLP 모델의 지속적인 성능 저하 문제를 해결한다.
  • 역사적 및 가용성 편향으로 인해 뉴스기사가 사실상 표준 훈련 데이터로 여겨지는 데에 대한 의존도를 도전한다.
  • 데이터 주석 스케일링 및 도메인 적응과 같은 기존 접근법이 언어 다양성을 다루는 데서 유한한 한계를 지닌다는 것을 규명한다.
  • 더 강력하고 적응력 있는 NLP 시스템을 위한 기초로 이질적이고 실제 세계의 데이터(운명적 데이터)를 수용하는 전략으로의 전환을 제안한다.
  • 언어, 장르, 연령, 사회적 요인 등 다양한 요소에서 발생하는 언어적 다양성을 더 잘 반영하기 위해 '도메인' 개념을 다차원적 '다양성 공간(variety space)'으로 재정의한다.

제안 방법

  • 비표준적, 활용되지 않는, 또는 원시적인 데이터로서 현재는 간과되고 있지만 언어적 다양성 모델링에 가치가 있는 '운명적 데이터(fortuitous data)' 개념을 도입한다.
  • 운명적 데이터를 고도화된 알고리즘과 조합하여 다양한 언어 양식 간의 강건성과 적응력을 향상시키는 방법을 제안한다.
  • 안정적이고 대표적인 평가를 확보하기 위해 부트스트랩 샘플링(k=150 문장)을 사용하여 다양한 테스트 세트에서의 모델 성능을 평가한다.
  • POS 태깅 정확도를 측정하고, OOV 비율 및 태그 이항분포의 KL-발산과 같은 언어적 특징과의 상관관계를 분석한다.
  • 트위터 데이터의 서브샘플에 대한 분석을 통해 단일 매체 내부에서도 여러 언어적 다양성이 존재함을 입증한다.
  • 피어슨의 ρ를 사용한 상관계분석을 통해 성능 저하와 OOV 비율, 분포 이탈 등의 언어적 공변량 간의 관계를 평가한다.

실험 결과

연구 질문

  • RQ1왜 NLP 모델은 비표준 언어에서 성능이 열등한가, 그리고 이는 훈련 데이터의 편향과 어떤 관련이 있는가?
  • RQ2연령, 장르, 언어 등에서의 언어적 다양성은 POS 태깅과 같은 작업의 모델 성능에 어느 정도 영향을 미치는가?
  • RQ3운명적 데이터는 다양한 언어 양식에서의 모델 강건성 향상에 효과적으로 활용될 수 있는가?
  • RQ4OOV 비율 및 태그 분포 이탈과 같은 언어적 공변량은 성능 저하와 어떻게 상관관계가 있는가?
  • RQ5NLP에서 '도메인' 개념은 너무 좁은 편이 아닌가, 만약 그렇다면 '다양성 공간' 프레임워크를 통해 언어적 다양성을 더 효과적으로 모델링할 수 있는가?

주요 결과

  • 비표준 데이터에서 성능 저하가 심각하게 나타나며, 유사한 매체이지만 서로 다른 트위터 샘플 간에도 POS 태깅 정확도에 큰 변동이 있다.
  • OOV 비율과 모델 정확도 사이에 강한 음의 상관관계(ρ = -0.70, p = 0.02274)가 존재하지만, oct27 트위터 샘플과 같은 이질적 데이터를 제외하면 이 상관관계는 약화된다.
  • 정답 태그 이항분포와 예측 태그 이항분포 간의 KL-발산이 성능과 높은 상관관계를 보이며, 이는 POS 시퀀스의 분포 이탈이 오류의 주요 원인임을 시사한다.
  • 유사한 매체(트위터)를 공유하는 두 트위터 샘플 간에도 OOV 비율(28 vs. 52)과 분포 이탈이 극명하게 다름을 보여, 트위터가 여러 언어 하위공간을 포함하고 있음을 입증한다.
  • WSJ 데이터로 훈련된 모델은 젊은 연령대 및 비영어 언어에서 성능이 열 劣하며, 모델 일반화의 알려진 편향을 확인한다.
  • 성능 변동과 언어적 공변량(예: OOV, 분포 이탈) 간의 상관관계는 매우 높으며(전반적인 변동에 대해 ρ = 0.95), 이 요소들을 모델링하는 것이 강건성에 핵심적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.