Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforced Iterative Knowledge Distillation for Cross-Lingual Named Entity Recognition

Shining Liang, Ming Gong|arXiv (Cornell University)|2021. 06. 01.
Topic Modeling참고 문헌 47인용 수 5
한 줄 요약

이 논문은 강화학습 기반의 인스턴스 선택기를 통해 타겟 언어의 레이블이 없는 데이터를 활용하여 소스 언어의 교사 모델에서 타겟 언어의 학생 모델로 지식 전이를 향상시키는 새로운 프레임워크인 강화 반복 지식 정련(Reinforced Iterative Knowledge Distillation, RIKD)을 제안한다. 이 방법은 반복적으로 정보성 있고 노이즈가 적은 훈련 예제를 선택함으로써 다양한 저자원 언어에서 최신 기술 성능을 달성하며, 산업 평가에서 이전 방법보다 최대 3.07 F1 포인트 향상시켰다.

ABSTRACT

Named entity recognition (NER) is a fundamental component in many applications, such as Web Search and Voice Assistants. Although deep neural networks greatly improve the performance of NER, due to the requirement of large amounts of training data, deep neural networks can hardly scale out to many languages in an industry setting. To tackle this challenge, cross-lingual NER transfers knowledge from a rich-resource language to languages with low resources through pre-trained multilingual language models. Instead of using training data in target languages, cross-lingual NER has to rely on only training data in source languages, and optionally adds the translated training data derived from source languages. However, the existing cross-lingual NER methods do not make good use of rich unlabeled data in target languages, which is relatively easy to collect in industry applications. To address the opportunities and challenges, in this paper we describe our novel practice in Microsoft to leverage such large amounts of unlabeled data in target languages in real production settings. To effectively extract weak supervision signals from the unlabeled data, we develop a novel approach based on the ideas of semi-supervised learning and reinforcement learning. The empirical study on three benchmark data sets verifies that our approach establishes the new state-of-the-art performance with clear edges. Now, the NER techniques reported in this paper are on their way to become a fundamental component for Web ranking, Entity Pane, Answers Triggering, and Question Answering in the Microsoft Bing search engine. Moreover, our techniques will also serve as part of the Spoken Language Understanding module for a commercial voice assistant. We plan to open source the code of the prototype framework after deployment.

연구 동기 및 목표

  • 높은 성능의 NER 모델을 인간 레이블링이 비용이 많이 드는 저자원 언어에 배포하는 데 도전하는 것.
  • 레이블이 부족한 산업 환경에서 대규모 레이블이 없는 타겟 언어 데이터를 효과적으로 활용하는 것.
  • 레이블이 없는 데이터에서 동적으로 가장 정보성 있는 훈련 인스턴스를 선택하여 다국어 NER에서 지식 정련을 향상시키는 것.
  • 인간 레이블링 데이터에 의존도를 줄이고 다양한 언어에서 높은 모델 성능을 유지하면서도 확장성 있고 산업용으로 구현 가능한 프레임워크를 개발하는 것.

제안 방법

  • 강화학습 기반의 인스턴스 선택기는 상태 벡터를 기반으로 레이블이 없는 타겟 언어 예제 중 어떤 것을 정제에 유지할지 정책 네트워크를 통해 결정한다. 상태 벡터에는 모델의 신뢰도, 예측 일致성, 의미적 특징, 입력 길이 등이 포함된다.
  • 상태 벡터에는 예측 신뢰도(f_conf), 교사와 학생의 예측 일致성(f_agree), 의미적 표현(f_semantic), 개체 특징(f_entities), 입력 길이(f_length) 등의 특징이 포함된다.
  • 이 프레임워크는 반복적인 지식 정련을 수행하며, 레이블이 없는 타겟 언어 데이터와 교사 모델의 예측 결과만을 사용해 학생 모델을 다수의 라운드에 걸쳐 개선한다.
  • 강화학습은 교사 및 학생 모델 간 예측 레이블의 일致성과 정보성에 기반한 조밀한 보상 신호를 최대화함으로써 선택 정책을 최적화한다.
  • 이 방법은 레이블이 있는 타겟 데이터에 의존하지 않고, 모델 예측에서 유도된 약한 지도 신호를 활용해 정제 과정을 이끌어낸다.
  • 최종 프레임워크는 산업적 구현을 고려해 설계되었으며, 아블레이션 연구를 통해 f_conf, f_agree, f_semantic과 같은 핵심 상태 특징의 중요성을 확인했다.

실험 결과

연구 질문

  • RQ1레이블이 없는 타겟 언어 데이터에서 정보성 있고 노이즈가 적은 인스턴스를 효과적으로 선택하기 위해 강화학습을 활용할 수 있는가?
  • RQ2제안된 RIKD 프레임워크는 기존의 지식 정련 및 준지도 학습 방법과 비교해 다국어 NER에서 어떻게 성능을 냈는가?
  • RQ3상태 벡터의 어떤 특징가 RIKD의 인스턴스 선택기 성능에 가장 기여하는가?
  • RQ4RIKD는 레이블이 있는 타겟 언어 데이터에 대한 의존도를 얼마나 줄일 수 있으며, 이와 동시에 NER 성능을 유지하거나 향상시킬 수 있는가?
  • RQ5RIKD는 대규모 다국어 데이터를 처리하는 실제 산업 환경에서 성공적으로 구현될 수 있는가?

주요 결과

  • RIKD는 다국어 NER에서 새로운 최신 기술 성능을 달성하였으며, 산업 테스트 세트에서 이전 방법보다 최대 3.07 F1 포인트 높은 성능을 기록했다.
  • CoNLL-2003 벤치마크에서 RIKD는 여섯 개의 타겟 언어 평균 F1 점수 65.36을 기록했으며, 기준 선택 전략보다 뚜렷이 뛰어난 성능을 보였다.
  • 아블레이션 연구는 f_conf, f_agree, f_semantic이 상태 벡터에서 가장 중요한 특징이며, 선택 정확도와 성능 향상에 가장 기여한다는 것을 확인했다.
  • 강화된 선택 방법은 배치당 평균 38.8%에서 60.8%의 훈련 케이스를 기각하여 노이즈가 많거나 정보성이 없는 인스턴스를 효과적으로 걸러내는 것으로 나타났다.
  • 실제 Microsoft Bing 배포 환경에서 RIKD는 Wu 등(2020k)보다 평균 F1 점수를 3.07 포인트 향상시켜 강력한 일반화 능력과 산업 적용 가능성의 가능성을 입증했다.
  • 이 방법은 아랍어(52.38 F1)와 중국어(32.14 F1)와 같은 저자원 언어를 포함한 다양한 언어에서 뛰어난 성능을 보였으며, 기준 모델 대비 뚜렷한 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.