Skip to main content
QUICK REVIEW

[논문 리뷰] A Closer Look at Loss Weighting in Multi-Task Learning

Baijiong Lin, Feiyang Ye|arXiv (Cornell University)|2021. 11. 20.
Domain Adaptation and Few-Shot Learning참고 문헌 42인용 수 15
한 줄 요약

이 논문은 랜덤 손실 가중치(RLW)를 제안하며, 성능이 뛰어난 최신 기법들과 맞먹는 간단하면서도 효과적인 다중태스크 학습 전략이다. RLW는 손실 가중치를 분포에서 랜덤으로 샘플링함으로써 국소 최소값에서 벗어나기 위한 확률을 높여 일반화 성능을 향상시키며, 기존 구현에 추가로 한 줄의 코드만 필요로 한다.

ABSTRACT

Multi-Task Learning (MTL) has achieved great success in various fields, however, how to balance different tasks to avoid negative effects is still a key problem. To achieve the task balancing, there exist many works to balance task losses or gradients. In this paper, we unify eight representative task balancing methods from the perspective of loss weighting and provide a consistent experimental comparison. Moreover, we surprisingly find that training a MTL model with random weights sampled from a distribution can achieve comparable performance over state-of-the-art baselines. Based on this finding, we propose a simple yet effective weighting strategy called Random Loss Weighting (RLW), which can be implemented in only one additional line of code over existing works. Theoretically, we analyze the convergence of RLW and reveal that RLW has a higher probability to escape local minima than existing models with fixed task weights, resulting in a better generalization ability. Empirically, we extensively evaluate the proposed RLW method on six image datasets and four multilingual tasks from the XTREME benchmark to show the effectiveness of the proposed RLW strategy when compared with state-of-the-art strategies.

연구 동기 및 목표

  • 다중태스크 학습(MTL)에서 여러 태스크를 균형 있게 조정하여 악성 전이를 방지하는 문제를 해결하기 위해.
  • 손실 가중치의 관점에서 여덟 가지 대표적인 태스크 균형 조정 방법을 통합하고 비교하기 위해.
  • 학습된 또는 고정된 가중치 전략과 비교해 랜덤 손실 가중치가 경쟁 가능한 성능을 달성할 수 있는지 조사하기 위해.
  • 랜덤 손실 가중치의 일반화 이점에 대해 이론적이고 실증적으로 검증하기 위해.

제안 방법

  • 저자는 손실 가중치의 공통 프레임워크 아래에서 여덟 가지 기존 태스크 균형 조정 방법을 통합하여 체계적인 비교를 수행한다.
  • RLW는 학습 중에 사전 정의된 분포에서 균일하게 손실 가중치를 샘플링하는 방식이다.
  • RLW는 기존의 MTL 프레임워크에 추가로 한 줄의 코드만으로도 쉽게 구현 가능하여 매우 실용적이다.
  • 이론적 분석을 통해 RLW는 고정된 가중치를 가진 모델보다 국소 최소값에서 벗어날 가능성이 더 높다는 것이 밝혀졌다.
  • 논문은 여섯 개의 이미지 데이터셋과 XTREME 벤치마크의 네 가지 다국어 태스크에서 이 방법을 평가하였다.

실험 결과

연구 질문

  • RQ1랜덤으로 손실 가중치를 샘플링하는 것이 다중태스크 학습에서 최신 기법의 고정 또는 학습된 가중치 전략과 비교해 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ2랜덤 손실 가중치는 모델이 열악한 국소 최소값에서 벗어나는 데 어떤 영향을 미치는가?
  • RQ3랜덤 손실 가중치로 관찰된 향상된 일반화 성능의 이론적 근거는 무엇인가?
  • RQ4RLW는 다양한 비전 및 NLP 벤치마크에서 강력한 성능을 유지하는가?

주요 결과

  • 랜덤 손실 가중치(RLW)는 여섯 개의 이미지 데이터셋과 XTREME 벤치마크의 네 가지 다국어 태스크에서 최신 기준 성능과 비교할 만한 성능을 달성한다.
  • 이론적 분석을 통해 RLW는 고정된 태스크 가중치를 가진 모델보다 국소 최소값에서 벗어날 가능성이 더 높다는 것이 밝혀졌다.
  • 가중치 샘플링의 확률적 성격 덕분에 훈련 중 탐색 능력이 향상되어 RLW는 더 나은 일반화 능력을 보인다.
  • 이 방법은 구현에 추가로 한 줄의 코드만 필요로 하여 매우 실용적이고, 기존의 MTL 프레임워크에 쉽게 통합할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.