[논문 리뷰] Continual Learning of a Mixed Sequence of Similar and Dissimilar Tasks
CAT는 유사 작업과 비유사 작업의 혼합 시퀀스를 보호된 비유사 작업 지식, 유사 작업에서의 선택적 지식 이전, 자동으로 작업 유사성 검출을 통해 학습하고, 단일 네트워크 내에서 망각 회피와 순방향/역방향 지식 이전을 가능하게 한다.
Existing research on continual learning of a sequence of tasks focused on dealing with catastrophic forgetting, where the tasks are assumed to be dissimilar and have little shared knowledge. Some work has also been done to transfer previously learned knowledge to the new task when the tasks are similar and have shared knowledge. To the best of our knowledge, no technique has been proposed to learn a sequence of mixed similar and dissimilar tasks that can deal with forgetting and also transfer knowledge forward and backward. This paper proposes such a technique to learn both types of tasks in the same network. For dissimilar tasks, the algorithm focuses on dealing with forgetting, and for similar tasks, the algorithm focuses on selectively transferring the knowledge learned from some similar previous tasks to improve the new task learning. Additionally, the algorithm automatically detects whether a new task is similar to any previous tasks. Empirical evaluation using sequences of mixed tasks demonstrates the effectiveness of the proposed model.
연구 동기 및 목표
- 연속 학습이 망각과 지식 이전을 모두 다루도록 유도한다.
- 망각을 방지하기 위해 공유 지식 베이스와 작업별 마스크를 사용하는 TCL 모델(CAT)을 제안한다.
- 지식 이전 주의 메커니즘을 통해 유사 작업에서 선택적으로 순방향 지식을 이전한다.
- 새 작업을 학습하는 동안 유사한 이전 작업을 개선하기 위해 역방향 지식 이전을 가능하게 한다.
- 현재 작업에 지식을 이전할 수 있는 이전 작업을 결정하기 위해 자동으로 작업 유사성을 검출한다.
제안 방법
- 모든 작업이 공유하는 학습 표현을 저장하는 지식 베이스(KB)를 도입한다.
- 비유사 작업에 중요한 유닛을 보호하고 현재 작업에 유용한 유닛을 식별하기 위해 작업별 이진 마스크를 훈련한다.
- 작업 ID 임베딩을 사용해 시그모이드 기반의 가짜 게이트를 통해 마스크를 도출하되 스케일링 파라미터 s를 사용한다.
- 유사 작업이 존재하면 지식 이전 주의(attention, KTA)를 적용해 유사 작업의 마스크된 출력들을 선별적으로 결합하여 순방향 이전을 수행한다.
- 전이된 지식을 사용해 현재 작업에 대해 별도의 f_KTA 분류기를 학습해 순방향 이전을 가능하게 하고, 새로운 작업 학습 시 유사한 과거 작업에 대한 역방향 업데이트를 허용한다.
- 병렬로 전이 모델과 무전이 기준선의 비교를 통해 TSV(작업 유사 벡터)를 결정하기 위해 유사성 탐지를 위한 참조 손실을 학습한다.
- 온라인으로 유사성을 탐지하기 위해 전이 모델 f_k→t와 참조 모델 f_∅를 사용하고, 전이가 검증 손실을 개선하면 k가 t와 유사하다고 분류한다.
실험 결과
연구 질문
- RQ1단일 네트워크가 비유사 작업의 망각을 방지하면서 유사 작업의 혼합 시퀀스를 학습할 수 있는가?
- RQ2모델이 유사 작업에서 지식을 선택적으로 이전해 새로운 작업 학습을 개선하고, 또한 과거 작업을 개선하기 위해 역방향 이전을 허용할 수 있는가?
- RQ3시스템이 작업 유사성을 자동으로 탐지해 적절한 이전 및 보호 메커니즘을 작동시킬 수 있는가?
- RQ4제안된 CAT 아키텍처가 혼합 작업 시퀀스에서 베이스라인보다 우수하며 구성 요소의 ablation이 기여를 지지하는가?
주요 결과
- CAT는 유사 및 비유사 작업의 혼합 시퀀스에서 강력한 TCL 베이스라인을 지속적으로 능가한다.
- 유사 작업에 대한 순방향 지식 이전이 매우 효과적이다.
- 새 작업 학습 후 일부 유사 작업에 대해 역방향 지식 이전이 더 나은 결과를 낼 수 있다.
- 지식 마스크는 비유사 작업에 대한 망각을 효과적으로 방지하면서 이전으로의 이전 여지도 남긴다.
- 작업 유사 탐지(TSV)와 지식 이전 주의(KTA)는 필수적이며, 제거 실험은 성능을 저하시킨다.
- CAT는 2-layer 완전 연결 네트워크 및 CNN 기반 아키텍처의 두 유형 데이터셋에서 강건성을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.