Skip to main content
QUICK REVIEW

[논문 리뷰] Potential Idiomatic Expression (PIE)-English: Corpus for Classes of Idioms

Tosin Adewumi, Roshanak Vadoodi|arXiv (Cornell University)|2021. 04. 25.
Natural Language Processing Techniques인용 수 8
한 줄 요약

이 논문은 20,174개의 영어 샘플과 10가지 비유어법 유형—은유, 비유, 유감, 인격화, 모순어, 역설, 과장, 풍자, 대등법, 직역—에 걸쳐 1,197개의 관용어 사례를 포함한 대규모 다중 클래스 주석 처리된 데이터셋인 Potential Idiomatic Expression (PIE)-English 코퍼스를 소개한다. 이는 88.89%의 높은 평가자 간 일致도를 기록하며, BERT가 93.4%의 정확도와 94.8%의 F1 스코어를 기록하는 등 분류 성능이 뛰어나, 자연어 처리 분야에서 토큰 기반 관용어 탐지 기술의 발전에 유용한 자원을 제공한다.

ABSTRACT

We present a fairly large, Potential Idiomatic Expression (PIE) dataset for Natural Language Processing (NLP) in English. The challenges with NLP systems with regards to tasks such as Machine Translation (MT), word sense disambiguation (WSD) and information retrieval make it imperative to have a labelled idioms dataset with classes such as it is in this work. To the best of the authors' knowledge, this is the first idioms corpus with classes of idioms beyond the literal and the general idioms classification. In particular, the following classes are labelled in the dataset: metaphor, simile, euphemism, parallelism, personification, oxymoron, paradox, hyperbole, irony and literal. We obtain an overall inter-annotator agreement (IAA) score, between two independent annotators, of 88.89%. Many past efforts have been limited in the corpus size and classes of samples but this dataset contains over 20,100 samples with almost 1,200 cases of idioms (with their meanings) from 10 classes (or senses). The corpus may also be extended by researchers to meet specific needs. The corpus has part of speech (PoS) tagging from the NLTK library. Classification experiments performed on the corpus to obtain a baseline and comparison among three common models, including the BERT model, give good results. We also make publicly available the corpus and the relevant codes for working with it for NLP tasks.

연구 동기 및 목표

  • 자연어 처리 분야에서 직역과 일반 관용어 분류를 초월한 대규모 다중 클래스 주석 처리 관용어 코퍼스의 부족 문제를 해결하기 위해.
  • 토큰 기반 관용어 탐지 모델의 훈련 및 평가를 위한 고품질 공개 코퍼스를 구축하기 위해.
  • 기계 번역, 단어 의미 해석, 정보 검색과 같은 자연어 처리 작업에서 세분화된 관용어 분류를 가능하게 하여 성능 향상을 도모하기 위해.
  • 伝통적 모델(mNB, SVM)과 최신 기술 BERT를 활용한 기준 모델 및 비교 평가를 제공하기 위해.
  • 미래의 도메인 특화 또는 자원이 제한된 자연어 처리 응용 분야를 위한 코퍼스 확장 지원을 위해.

제안 방법

  • 코퍼스는 영국 국립 코퍼스(96.9%)와 영국 웹 페이지(3.1%)에서 수집하여 10개의 비유어법 유형에 대해 수작업 주석 처리하였다.
  • 두 명의 독립된 주석자 간 평가자 간 일치도는 88.89%로 측정되어 주석 품질이 높음을 확인하였다.
  • 코퍼스의 언어적 특징을 향상시키기 위해 NLTK 라이브러리를 사용해 품사 태깅을 적용하였다.
  • 데이터셋의 클래스 불균형 문제를 해결하기 위해 계층적 85:15 훈련-검증 세트 분할을 실시하였다.
  • 기준 비교를 위해 다항 베이즈, 선형 서포트 벡터 머신, BERT의 세 가지 모델을 훈련 및 평가하였다.
  • 모델 훈련 이전에 소문자화, HTML 태그 제거, 기호 및 숫자 필터링 등의 전처리 작업을 수행하였다.

실험 결과

연구 질문

  • RQ1직역과 일반 관용어를 초월한 세분화된 분류를 포함한 대규모 다중 클래스 관용어 코퍼스를 실제 자연어 처리 환경에서 구축할 수 있는가?
  • RQ2다양한 비유어법 유형을 포함한 실세계 자연어 처리 맥락에서 평가자 간 일치도는 어떻게 평가되는가?
  • RQ3기존 모델과 최신 기술 BERT가 10개의 서로 다른 비유어법 유형으로 관용어를 분류하는 데에서 성능은 어떠한가?
  • RQ4클래스 불균형이 모델 성능에 미치는 영향은 어느 정도이며, 데이터 증강 또는 모델 설계를 통해 이를 완화할 수 있는가?
  • RQ5PIE-English 코퍼스는 향후 토큰 기반 관용어 탐지 및 비유어법 이해 연구의 신뢰할 수 있는 기준 자료로 활용될 수 있는가?

주요 결과

  • PIE-English 코퍼스는 20,174개의 샘플과 10개의 비유어법 유형에 걸쳐 1,197개의 고유한 관용어 사례를 포함하며, 은유가 가장 빈도가 높은 유형(14,666개 샘플)이다.
  • 평가자 간 일치도 스코어는 88.89%에 도달하여 주석 처리 과정의 강한 일致성과 신뢰성을 입증하였다.
  • BERT는 93.4%의 정확도와 94.8%의 F1 스코어를 기록하여 mNB(74.7% 정확도)와 SVM(76.6% 정확도)를 크게 앞서는 최고의 성능을 보였다.
  • 비유(97.5% 정확도)와 비유(99.6% 정확도)에 대해서는 거의 완벽한 성능을 기록하였지만, 과장, 모순어, 풍자 유형은 훈련 샘플 수가 극히 적어 매우 낮은 성능을 보였다.
  • 오류 분석 결과, 은유는 종종 직역 또는 유감으로 잘못 분류되었으며, 유감은 종종 은유와 혼동되는 경향이 있었는데, 이는 훈련 데이터에서 은유의 지배적 우세성 때문으로 보인다.
  • 코퍼스는 코드와 함께 공개되어 있어 향후 전문화된 자연어 처리 작업, 특히 자원이 제한된 또는 도메인 특화 환경에서의 확장 및 적용을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.