[논문 리뷰] An English-Hindi Code-Mixed Corpus: Stance Annotation and Baseline System
이 논문은 인도의 2016년 화폐 개혁 정책에 대한 태도를 분석하기 위해 3,545개의 수작업 레이블이 부여된 영어-힌두어 혼합 트위터 코퍼스를 처음으로 제시한다. 이는 문자 n-그램, 단어 n-그램, 태도를 나타내는 토큰을 사용한 기반 태도 검출 시스템을 도입하여 RBF 커널 서포트 벡터 머신을 사용한 10겹 교차 검증에서 58.7%의 정확도를 달성하였으며, 자원이 제한된 多어 섞인 환경에서의 혼합어 태도 검출을 위한 기초 자원으로서의 의의를 지닌다.
Social media has become one of the main channels for peo- ple to communicate and share their views with the society. We can often detect from these views whether the person is in favor, against or neu- tral towards a given topic. These opinions from social media are very useful for various companies. We present a new dataset that consists of 3545 English-Hindi code-mixed tweets with opinion towards Demoneti- sation that was implemented in India in 2016 which was followed by a large countrywide debate. We present a baseline supervised classification system for stance detection developed using the same dataset that uses various machine learning techniques to achieve an accuracy of 58.7% on 10-fold cross validation.
연구 동기 및 목표
- 높은 영향력이 있는 소셜 미디어 이벤트에 대한 태도 검출을 위한 대규모 수작업 레이블이 부여된 영어-힌두어 혼합 코퍼스를 구축하기 위해.
- 특히 영어-힌두어 혼합 언어에 대한 의견 마이닝 자원의 부족을 해결하기 위해.
- 이 새로운 코퍼스를 기반으로 다양한 기계 학습 기법을 사용해 기반 태도 검출 시스템을 개발하고 평가하기 위해.
- 향후 혼합어 NLP 연구, 예를 들어 언어 식별 및 다어성 태도 검출을 가능하게 하기 위해.
- 재현 가능성과 향후 개발을 위해 데이터셋과 기반 모델을 오픈소스로 제공하기 위해.
제안 방법
- 2016년 이후 6개월 간의 기간 동안 'notebandi'와 'demonetisation' 키워드를 사용해 트위터 스크래퍼 API를 통해 3,545개의 영어-힌두어 혼합 트윗을 수집하였다.
- 모든 트윗을 'FAVOR', 'AGAINST', 또는 'NONE' 태도로 수작업 레이블링하였으며, 현지 힌두어-영어 다언어자들이 참여하여 코HEN의 카파 값 0.82를 달성하였다.
- 각 토큰을 영어 또는 힌두어로 토큰 수준의 언어 레이블링을 수행한 후 오류 수정을 위한 수작업 검토를 실시하였다.
- 세 가지 유형의 특징을 추출하였다: 문자 n-그램(n=1에서 3까지, 빈도 ≥8), 단어 n-그램(n=1에서 5까지, 빈도 ≥10), 태도를 나타내는 토큰(점수 ≥0.6, 빈도 ≥5).
- 특징 공간을 각 클래스별로 가장 관련성이 높은 500개의 특징으로 줄이기 위해 카이제곱 특징 선택을 적용하였다.
- 모든 특징 세트를 사용한 10겹 교차 검증을 통해 세 가지 분류기—RBF 커널 서포트 벡터 머신, 랜덤 포레스트, 선형 서포트 벡터 머신—을 평가하였다.
실험 결과
연구 질문
- RQ1기본 기계 학습 모델의 성능은 영어-힌두어 혼합 소셜 미디어 텍스트에서 태도를 탐지하는 데 어떻게 나타나는가?
- RQ2다양한 특징 유형(문자 n-그램, 단어 n-그램, 태도를 나타내는 토큰)은 개별적으로나 종합적으로 태도 검출 정확도에 어떻게 기여하는가?
- RQ3새로 생성된 수작업 레이블이 부여된 혼합어 코퍼스를 기반으로 감독 학습 기반의 태도 검출 시스템을 효과적으로 학습시킬 수 있는가?
- RQ4다른 평가자 간의 일致도는 혼합어 다어성 텍스트에서 태도 레이블링의 신뢰성과 어떻게 관련되는가?
- RQ5이 코퍼스는 언어 식별 및 감성 분석과 같은 혼합어 NLP 작업의 발전 잠재력을 얼마나 지니고 있는가?
주요 결과
- RBF 커널 서포트 벡터 머신은 모든 세 가지 특징 유형을 조합하여 사용했을 때 가장 높은 정확도 58.7%를 달성하였다.
- 모든 세 가지 개별 특징 유형—문자 n-그램, 단어 n-그램, 태도를 나타내는 토큰—은 거의 동일한 기여를 하였으며, 정확도는 54.6%에서 54.8% 사이를 오갔다.
- 랜덤 포레스트 분류기는 모든 특징을 사용했을 때 54.7%의 정확도를 기록하였고, 선형 서포트 벡터 머신은 동일한 조건에서 56.6%의 정확도를 달성하였다.
- 태도 레이블링에 대한 평가자 간 일치도는 코헨의 카파 값 0.82로 상당히 높아, 강력한 레이블 일관성을 나타내었다.
- 데이터셋과 기반 시스템은 GitHub에 공개되어 있어 재현 가능성과 혼합어 NLP 분야의 향후 개발을 가능하게 한다.
- 본 연구는 영어-힌두어와 같은 자원이 제한된 언어 쌍에 대해 인도의 혼합어 소셜 미디어에서 태도 검출을 위한 기초 기준을 설정하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.