Skip to main content
QUICK REVIEW

[논문 리뷰] Don't forget, there is more than forgetting: new metrics for Continual Learning

Natalia Díaz-Rodríguez, Vincenzo Lomonaco|arXiv (Cornell University)|2018. 10. 31.
Domain Adaptation and Few-Shot Learning참고 문헌 11인용 수 74
한 줄 요약

이 논문은 시간에 따른 정확도, 역방향/전방 전이, 메모리 및 계산을 포괄하는 구현에 의존하지 않는 포괄적 연속학습(CL) 지표를 제안하고 이를 알고리즘 순위를 매기기 위한 유연한 CL_score로 결합한다.

ABSTRACT

Continual learning consists of algorithms that learn from a stream of data/tasks continuously and adaptively thought time, enabling the incremental development of ever more complex knowledge and skills. The lack of consensus in evaluating continual learning algorithms and the almost exclusive focus on forgetting motivate us to propose a more comprehensive set of implementation independent metrics accounting for several factors we believe have practical implications worth considering in the deployment of real AI systems that learn continually: accuracy or performance over time, backward and forward knowledge transfer, memory overhead as well as computational efficiency. Drawing inspiration from the standard Multi-Attribute Value Theory (MAVT) we further propose to fuse these metrics into a single score for ranking purposes and we evaluate our proposal with five continual learning strategies on the iCIFAR-100 continual learning benchmark.

연구 동기 및 목표

  • 잊힘을 넘어서는 폭넓은 평가를 지속학습(CL) 시스템에 동기 부여한다.
  • 시간에 따른 정확도, 전이, 메모리 및 계산을 포괄하는 구현 독립적인 포괄적 지표 집합을 정의한다.
  • 다중 기준 집계(C L_score) 제안 및 CL 전략 순위화에 대한 유용성 평가.
  • 제안된 지표를 설명하기 위해 iCIFAR-100 벤치마크에서 다섯 가지 CL 전략을 평가한다.

제안 방법

  • 집계 가능하도록 MAVT에서 영감을 얻은 정규화를 사용하여 각 기준을 [0,1] 척도로 매핑한다.
  • 시간 의존 지표로서 정확도, 망각 및 기억 구성 요소를 포함한 Backward Transfer(BWT) 및 Forward Transfer(FWT)를 정의한다.
  • 효율성 지표로서 Model Size(MS), Samples Storage Size(SSS), 및 Computational Efficiency(CE)를 도입한다.
  • 해당 지표의 가중합으로 최종 CL_score를 계산하고 해석 가능성을 위해 정규화한다.
  • 다양한 실행에서 기준 점수의 표준편차를 바탕으로 CL_stability라는 안정성 지표를 제공한다.
  • CNN 기본 모델을 사용하여 iCIFAR-100에서 다섯 가지 CL 전략(Naïve, Cumulative, EWC, LwF, SI)을 평가하고 전략별 지표를 보고한다.

실험 결과

연구 질문

  • RQ1제안된 지표가 CL 방법의 시간에 따른 동적 성능을 어떻게 포착하는가.
  • RQ2제안된 전체 지표 세트를 사용하여 서로 다른 CL 전략들이 어떻게 비교되는가?
  • RQ3집계된 CL_score가 정확도, 전이, 메모리 및 계산 간의 트레이드오프를 어떻게 반영하는가?
  • RQ4다른 전략들에서 다중 실행에 걸친 이러한 지표의 변동성(안정성)은 얼마나 되는가?

주요 결과

  • 정확도(Accuracy), REM(remembering), BWT+, FWT, MS, SSS, 및 CE를 포함하는 포괄적 지표 세트를 제안한다.
  • 다섯 가지 CL 전략(Naïve, Cumulative, EWC, LwF, SI)을 iCIFAR-100에서 평가하고 각 지표를 보여주는 주요 표에 결과를 요약한다.
  • CL_score는 동등한 가중치나 사용자가 지정한 가중치로 지표를 집계하여 전략을 순위화하며, LwF가 여러 지표에서 종종 우수한 성능을 보인다.
  • 본 연구는 정확도/잊힘을 넘는 지표들이 전략 간의 의미 있는 구분을 제공하며 메모리, 계산 및 전이 간의 트레이드오프를 강조한다.
  • 실행 간 변동성은 Fig. 1을 통해 보여지며 CL 연구에서 다중 지표 평가의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.