Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Selectively Transfer: Reinforced Transfer Learning for Deep Text Matching

Chen Qu, Feng Ji|arXiv (Cornell University)|2018. 12. 30.
Topic Modeling참고 문헌 42인용 수 5
한 줄 요약

이 논문은 딥 텍스트 매칭 작업을 위한 고품질의 소스 도메인 데이터를 선택적으로 전이하기 위해 딥 강화 학습을 활용하는 새로운 방법인 강화 전이 학습(Reinforced Transfer Learning, RTL)을 제안한다. 정책 네트워크를 통해 소스 인스턴스를 선택하고, DNN 기반의 전이 학습 모델과 함께 공동으로 훈련함으로써, 병문제 식별 및 자연어 추론 작업에서 성능을 향상시키고, 보상 기반의 데이터 선택을 통해 부정적 전이를 감소시킨다.

ABSTRACT

Deep text matching approaches have been widely studied for many applications including question answering and information retrieval systems. To deal with a domain that has insufficient labeled data, these approaches can be used in a Transfer Learning (TL) setting to leverage labeled data from a resource-rich source domain. To achieve better performance, source domain data selection is essential in this process to prevent the "negative transfer" problem. However, the emerging deep transfer models do not fit well with most existing data selection methods, because the data selection policy and the transfer learning model are not jointly trained, leading to sub-optimal training efficiency. In this paper, we propose a novel reinforced data selector to select high-quality source domain data to help the TL model. Specifically, the data selector "acts" on the source domain data to find a subset for optimization of the TL model, and the performance of the TL model can provide "rewards" in turn to update the selector. We build the reinforced data selector based on the actor-critic framework and integrate it to a DNN based transfer learning model, resulting in a Reinforced Transfer Learning (RTL) method. We perform a thorough experimental evaluation on two major tasks for text matching, namely, paraphrase identification and natural language inference. Experimental results show the proposed RTL can significantly improve the performance of the TL model. We further investigate different settings of states, rewards, and policy optimization methods to examine the robustness of our method. Last, we conduct a case study on the selected data and find our method is able to select source domain data whose Wasserstein distance is close to the target domain data. This is reasonable and intuitive as such source domain data can provide more transferability power to the model.

연구 동기 및 목표

  • 대상 도메인의 레이블이 부족한 상황에서 텍스트 매칭을 위한 전이 학습에서 발생하는 부정적 전이의 문제를 해결한다.
  • 기존의 데이터 선택 방법이 전이 학습 모델과 함께 공동 최적화되지 않는 한계를 극복한다.
  • 데이터 선택과 모델 훈련이 종단 간 최적화되는 통합 프레임워크를 개발하여 전이 효율성과 효과를 향상시킨다.
  • 선택된 소스 데이터가 대상 도메인과 더 분포적으로 유사한지 조사한다. 이는 전이 가능성 향상에 기여한다.

제안 방법

  • 에이전트가 소스 인스턴스를 선택하여 전이 학습 모델을 훈련시키는 방식으로, 데이터 선택 과정을 순차적 결정 문제로 공식화한다.
  • 액터-크리틱 프레임워크 설계: 액터(데이터 선택기)는 어떤 소스 샘플을 포함할지 선택하고, 크리틱은 결과적으로 얻어진 전이 학습 모델 성능에 기반해 선택의 질을 평가한다.
  • 상태를 현재 훈련 배치와 대상 도메인 데이터의 표현으로 정의함으로써, 맥락 인식 선택 결정을 가능하게 한다.
  • 전이 학습 모델의 성능 향상(예: F1 점수 또는 정확도)을 희박한 보상 신호로 사용하여 선택기의 정책을 갱신한다.
  • 강화된 데이터 선택기를 딥 네트워크 기반 전이 학습 모델에 통합하여, 선택과 학습의 공동 최적화를 가능하게 한다.
  • 소스 도메인과 대상 도메인 간의 분포 유사도를 측정하기 위해 워샤프스키 거리를 적용하여, 선택된 데이터가 분포 측면에서 대상 도메인에 더 가까운지 검증한다.

실험 결과

연구 질문

  • RQ1강화 학습 기반의 데이터 선택기가 무작위 또는 히우리스틱 선택 대비 텍스트 매칭 작업에서 전이 학습 성능을 향상시키는가?
  • RQ2제안된 RTL 방법이 소스 데이터를 대상 도메인의 분포와 유사하게 선택함으로써 부정적 전이를 감소시키는가?
  • RQ3상태 표현, 보상 설계, 정책 최적화 방법의 변화에 대해 RTL 프레임워크는 얼마나 강인한가?
  • RQ4워샤프스키 거리로 측정했을 때, 선택된 소스 데이터의 분포가 무작위 선택 또는 제거된 데이터보다 대상 도메인에 더 가까운가?

주요 결과

  • RTL 방법은 병문제 식별 및 자연어 추론 작업 모두에서 기준 전이 학습 및 데이터 선택 방법 대비 통계적으로 유의미한 성능 향상을 보였다.
  • 선택된 소스 데이터(D_select)는 원본 소스 데이터보다 대상 도메인과 더 낮은 워샤프스키 거리를 보였으며, 이는 분포 유사도가 더 높음을 시사한다(병문제 식별: 4.963×10⁻⁶, 자연어 추론: 3.190×10⁻⁶).
  • 제거된 소스 데이터(D_drop)는 원본 소스 데이터보다 높은 워샤프스키 거리를 보였으며(5.320×10⁻⁶ 및 3.290×10⁻⁶), 이는 관련성이 낮고 잠재적으로 해로울 수 있음을 시사한다.
  • 무작위 선택된 데이터(D_rand)는 최소한의 분포 이질성(5.232×10⁻⁶ 및 3.243×10⁻⁶)을 보이며 안정적인 기준선으로 기능한다.
  • 상태 표현, 보상 함수, 정책 최적화 전략의 다양성에 대해 메서드는 일관된 성능 향상을 보이며 강인함을 입증한다.
  • 사례 연구를 통해 강화된 선택기가 대상 도메인과 유사한 용어 분포를 가진 소스 인스턴스를 우선순위로 선택하는 것을 학습하는 것으로 확인되었으며, 이는 전이 가능성의 직관적 원칙을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.