Skip to main content
QUICK REVIEW

[논문 리뷰] ERNIE at SemEval-2020 Task 10: Learning Word Emphasis Selection by Pre-trained Language Model

Zhengjie Huang, Shikun Feng|arXiv (Cornell University)|2020. 09. 08.
Natural Language Processing Techniques참고 문헌 10인용 수 8
한 줄 요약

이 논문은 시각 미디어 디자인을 위한 짧은 텍스트에서 강조할 단어를 선택하는 SemEval-2020 Task 10에서 최고 성능을 기록한 시스템을 제시한다. 특히 ERNIE 2.0를 포함한 사전 훈련된 언어 모델을 활용하고, 점수 기반 평균 제곱오차(MSE)와 순서 기반 랭킹 손실을 조합한 하이브리드 손실 함수, 문맥 강조를 위한 어휘적 특징(대문자, 해시태그) 및 데이터 증강 기법을 적용하여 최신 기준 점수 0.823을 달성했으며, 모든 평가 지표에서 1위를 기록했다.

ABSTRACT

This paper describes the system designed by ERNIE Team which achieved the first place in SemEval-2020 Task 10: Emphasis Selection For Written Text in Visual Media. Given a sentence, we are asked to find out the most important words as the suggestion for automated design. We leverage the unsupervised pre-training model and finetune these models on our task. After our investigation, we found that the following models achieved an excellent performance in this task: ERNIE 2.0, XLM-ROBERTA, ROBERTA and ALBERT. We combine a pointwise regression loss and a pairwise ranking loss which is more close to the final M atchm metric to finetune our models. And we also find that additional feature engineering and data augmentation can help improve the performance. Our best model achieves the highest score of 0.823 and ranks first for all kinds of metrics

연구 동기 및 목표

  • 시각 미디어 디자인을 위한 짧은 문장에서 가장 중요한 단어를 자동으로 선별하는 방법을 개발하는 것.
  • 일관되지 않은 평가자 기준으로 인해 제한된 커뮤니티 기반 애너테이션 데이터 문제를 해결하는 것.
  • 사전 훈련된 언어 모델과 작업에 특화된 미세조정 전략을 활용하여 강조 단어 선별 성능을 향상시키는 것.
  • 저자원 환경에서 보조적 특징과 데이터 증강의 효과성을 탐구하는 것.

제안 방법

  • 순차적 레이블링 프레임워크를 사용하여 강조 단어 선별 작업에 대해 ERNIE 2.0, XLM-ROBERTA, RoBERTa, ALBERT와 같은 사전 훈련된 언어 모델을 미세조정한다.
  • 최종 평가 지표인 Match_m와의 일치를 높이기 위해 평균 제곱오차(MSE)를 사용한 점수 기반 회귀 손실과 순서 기반 랭킹 손실을 조합한 하이브리드 손실 함수를 적용한다.
  • 시각적 강조 신호를 인지할 수 있도록 대문자 사용 여부, 해시태그 존재 여부 등의 명시적 어휘적 특징을 0-1 벡터로 통합한다.
  • 작은 훈련 데이터셋에서의 과적합을 줄이기 위해 무작위 단어 제거(1%), 무작위 대문자 변환(5%), 문장 뒤집기(10%)를 활용한 데이터 증강 기법을 사용한다.
  • 작은 데이터셋에서 높은 분산이 발생하므로 안정적인 성능 평가를 위해 8겹 교차검증을 실시하고, 각 폴드에 대해 5번의 랜덤 실행을 수행한다.
  • 최고 성능을 기록한 구성 요소들을 앙상블하여 최종 제출을 도출함으로써 안정성과 점수를 극대화한다.

실험 결과

연구 질문

  • RQ1저자원 환경에서 강조 단어 선별 작업에 대해 사전 훈련된 언어 모델은 얼마나 효과적인가?
  • RQ2기본 회귀 손실 대비 순서 기반 랭킹 손실이 Match_m 평가 지표와의 일치도를 향상시키는가?
  • RQ3대문자, 해시태그 등의 명시적 어휘적 특징은 강조 예측 성능 향상에 기여하는가?
  • RQ4데이터 증강은 제한된 커뮤니티 기반 데이터셋에서 과적합을 어느 정도 완화하는가?

주요 결과

  • ERNIE 2.0-Large는 8겹 교차검증에서 평균 순위 점수 0.7810을 기록하여 XLM-ROBERTA-Large, RoBERTa-Large, ALBERT-XXLarge-v2를 모두 앞서는 최고 성능을 보였다.
  • 순서 기반 랭킹 손실은 평균 점수 상승 폭이 -0.00544로 평균적으로 성능을 약간 저하시켰지만, 일부 케이스에서는 성능 향상을 기록했다.
  • 어휘적 특징은 가장 일관된 성능 향상을 보였으며, 평균 +0.00105의 향상과 최대 +0.00709의 향상 효과를 기록했다.
  • 데이터 증강은 과적합을 감소시키고 평균 -0.00144의 점수 향상을 기여했지만, 다양한 모델에 따라 영향의 크기가 달랐다.
  • 최종 앙상블 모델은 0.823의 최고 점수를 기록하여 SemEval-2020 Task 10 경연 대회에서 모든 평가 지표에서 1위를 차지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.