Skip to main content
QUICK REVIEW

[논문 리뷰] Worst-Case-Aware Curriculum Learning for Zero and Few Shot Transfer

Sheng Zhang, Xin Zhang|arXiv (Cornell University)|2020. 09. 23.
Domain Adaptation and Few-Shot Learning참고 문헌 30인용 수 8
한 줄 요약

이 논문은 다중 작업 전이 학습을 위한 최악의 경우를 고려한 커리큘럼 학습 프레임워크를 제안하며, 최악의 경우 손실을 최소화하도록 작업을 동적으로 선택함으로써 제로샷 및 희소샷 일반화를 향상시킨다. 버퍼 내 작업 성능을 기반으로 샘플링을 최적화하기 위해 다중 손잡이 랜덤 보상 기반의 강화 학습 기법을 사용함으로써, 명시적인 데이터 크기 가중치 없이도 소규모 및 이방성 작업에 대해 더 높은 강건성을 확보한다.

ABSTRACT

Multi-task transfer learning based on pre-trained language encoders achieves state-of-the-art performance across a range of tasks. Standard approaches implicitly assume the tasks, for which we have training data, are equally representative of the tasks we are interested in, an assumption which is often hard to justify. This paper presents a more agnostic approach to multi-task transfer learning, which uses automated curriculum learning to minimize a new family of worst-case-aware losses across tasks. Not only do these losses lead to better performance on outlier tasks; they also lead to better performance in zero-shot and few-shot transfer settings.

연구 동기 및 목표

  • 표준 다중 작업 학습이 평균 손실을 최소화하는 데서 비롯되는 한계를 해결하라. 이는 이방성 또는 소규모 작업에서의 성능 저하를 초래할 수 있다.
  • 훈련 데이터가 부족하거나 존재하지 않는 제로샷 및 희소샷 설정에서 도메인 외부 작업으로의 일반화를 향상시켜라.
  • 균형 잡힌 손실 비율 또는 크기 비례 히وري스틱에 의존하지 않고 최악의 경우 성능에 기반해 샘플링을 동적으로 조정하는 강건한 자동 커리큘럼 학습 전략을 개발하라.
  • 높은 손실 또는 뒤처진 손실을 보이는 작업을 동적으로 우선순위를 매김으로써 저자원 작업에서의 성능 향상을 달성하라.
  • 최대화와 손실 비례 전략 사이를 보간하는 일반적인 최악의 경우를 고려한 목표 함수의 가족을 수학적으로 정의하라.

제안 방법

  • 최근 훈련 손실에서의 최악의 경우 성능에 기반해 작업을 선택하는 동적 샘플링 정책을 학습하기 위해 다중 손잡이 랜덤 보상 기반의 강화 학습 기법을 사용하라.
  • 최근 훈련 단계 동안 각 작업의 평균 손실을 저장하는 선입선출(FIFO) 버퍼를 유지하여 샘플링 결정에 활용하라.
  • 파라미터 φ로 파arameterized된 최악의 경우를 고려한 손실 목표 함수의 가족을 정의하라. 여기서 φ=0은 손실 비례 샘플링에 해당하고, φ=1은 엄격한 최악의 경우 최소화에 해당한다.
  • 기본 모델이나 손실 계산 방식을 수정하지 않고도 표준 다중 작업 훈련 파이프라인에 커리큘럼 학습 래퍼를 통합하라.
  • 모든 작업의 최악의 경우 손실에서 유도된 보상 신호를 기반으로 랜덤 보상 정책을 훈련시켜, 현재 손실이 가장 높은 작업을 우선 선택하도록 유도하라.
  • GLUE 벤치마크에서 사전 학습된 언어 모델에 이 방법을 적용하여 도메인 내 및 도메인 외부 전이 성능을 평가하라.

실험 결과

연구 질문

  • RQ1표준 다중 작업 학습과 비교해 볼 때, 최악의 경우를 고려한 커리큘럼 학습 전략은 제로샷 및 희소샷 전이 설정에서 일반화 성능을 향상시키는가?
  • RQ2최악의 경우 성능에 기반한 동적 작업 샘플링은 크기가 다른 작업들 간의 학습 동역학과 수렴 특성에 어떤 영향을 미치는가?
  • RQ3최악의 경우 손실을 최소화하는 것이 균일하거나 크기 비례 샘플링 전략보다 소규모 또는 이방성 작업에서 더 높은 성능을 내는가?
  • RQ4고정 또는 히وري스틱 기반 커리큘럼과 비교해 볼 때, 제안된 방법은 강건성과 전이 성능 측면에서 어떤가?
  • RQ5명시적인 데이터 크기나 복잡도 지시 없이, 자동 커리큘럼 학습 전략이 작업 난이도에 어떻게 적응하는가?

주요 결과

  • 제안된 방법은 표준 다중 작업 학습과 비교해 GLUE 벤치마크에서 경쟁적 또는 略적으로 높은 평균 성능을 달성한다.
  • 특히 데이터가 적은 환경에서 SICK-R/E, SciTail, WikiQA와 같은 소규모 작업에서 성능 향상이 뚜렷하게 관찰된다.
  • φ=1(엄격한 최악의 경우 최소화)일 경우, 모든 작업의 훈련 손실 곡선이 더 가까이 수렴함으로써 균형 잡힌 학습과 분산 감소를 나타낸다.
  • 랜덤 보상 정책이 학습한 샘플링 전략은 균일 및 크기 비례 기반 전략과 다름을 보이며, 소규모 작업이 예상보다 더 자주 샘플링된다.
  • 제로샷 및 희소샷 설정에서 도메인 외부 데이터셋으로의 일반화 성능이 향상되어 분포 이탈에 대한 강건성이 향상됨을 보여준다.
  • 학습 동역학 분석 결과, 명시적인 데이터 크기나 복잡도 특징 없이도 버퍼 내 손실 추세에 기반해 커리큘럼이 작업 난이도에 적응함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.