Skip to main content
QUICK REVIEW

[논문 리뷰] Tilted Empirical Risk Minimization

Tian Li, Ahmad Beirami|arXiv (Cornell University)|2020. 07. 02.
Statistical Methods and Inference참고 문헌 77인용 수 4
한 줄 요약

이 논문은 초모수 '기울기(tilt)'를 사용하여 개별 손실의 영향을 탄력적으로 조절함으로써 일반화된 경험 위험 최소화(ERM)를 확장하는 통합 프레임워크인 기울기 경험이론 최소화(Terminal Empirical Risk Minimization, TERM)를 소개한다. 기울기를 조절함으로써 TERM은 이상치에 대한 강건성, 하위군 간 공정성 향상, 일반화를 위한 분산 감소, 클래스 불균형 처리 등 다양한 성능 향상을 달성하며, 단일 유연한 목적함수로 다양한 기계학습 응용 분야에서 전문적 방법들을 능가하거나 동등하게 성능을 발휘한다.

ABSTRACT

Empirical risk minimization (ERM) is typically designed to perform well on the average loss, which can result in estimators that are sensitive to outliers, generalize poorly, or treat subgroups unfairly. While many methods aim to address these problems individually, in this work, we explore them through a unified framework -- tilted empirical risk minimization (TERM). In particular, we show that it is possible to flexibly tune the impact of individual losses through a straightforward extension to ERM using a hyperparameter called the tilt. We provide several interpretations of the resulting framework: We show that TERM can increase or decrease the influence of outliers, respectively, to enable fairness or robustness; has variance-reduction properties that can benefit generalization; and can be viewed as a smooth approximation to a superquantile method. We develop batch and stochastic first-order optimization methods for solving TERM, and show that the problem can be efficiently solved relative to common alternatives. Finally, we demonstrate that TERM can be used for a multitude of applications, such as enforcing fairness between subgroups, mitigating the effect of outliers, and handling class imbalance. TERM is not only competitive with existing solutions tailored to these individual problems, but can also enable entirely new applications, such as simultaneously addressing outliers and promoting fairness.

연구 동기 및 목표

  • 표준 ERM의 한계를 해결하기 위해 평균 성능 최적화에 의존하나 이상치에 민감하거나 하위군에 대한 공정성 문제가 있거나 일반화 성능이 열 劣할 수 있음을 고려한다.
  • 이상치 강건성, 공정성, 클래스 불균형, 분산 감소 등의 다수의 도전 과제를 단일 유연한 최적화 프레임워크로 통합한다.
  • 존재하는 방법들이 한 가지 문제에만 국한되는 데 반해, TERM이 동시에 여러 문제(예: 공정성과 강건성)를 해결할 수 있음을 보여준다.
  • TERM의 효과성에 대한 이론적 및 실증적 근거를 다양한 기계학습 응용 분야에 걸쳐 제공한다.

제안 방법

  • TERM은 초모수 t를 사용해 ERM를 확장하며, 목적함수를 R̃(t;θ) = (1/t) log( (1/N) Σ e^{t f(xi;θ)} )로 정의한다. 이는 t=0에서 ERM로 일반화된다.
  • t < 0일 경우 TERM은 큰 손실을 억제하여 이상치의 영향을 줄이고 강건성을 향상시키며, t > 0일 경우 큰 손실을 증폭시켜 최소-최대 또는 분산 감소 행동을 유도한다.
  • 이 프레임워크는 초수준(conditional value-at-risk) 방법의 매끄러운 근사로 해석되며, 강건 최적화와 연결된다.
  • 효율적인 실행을 위해 배치 및 스트로스틱 1차 최적화 방법이 개발되어 실용적 구현이 가능해졌다.
  • 초모수 t는 실험 전반에서 적응적으로 조정되며, 강건성 및 공정성에는 음수 값, 분산 감소 또는 불균형 처리에는 양수 값을 사용한다.
  • TERM은 일관된 최적화 및 초모수 조정을 통해 강건 회귀, 공정한 주성분 분석(fair PCA), 불균형 분류, 분산 감소 등 다양한 작업에 적용되었다.

실험 결과

연구 질문

  • RQ1이상치, 공정성, 클래스 불균형 처리를 위한 다수의 전문적 방법을 효과적으로 대체할 수 있는 단일 통합 프레임워크가 존재하는가?
  • RQ2기울기 초모수 t가 평균 성능와 악성 경우 또는 하위군별 성능 간의 트레이드오프를 어떻게 조절하는가?
  • RQ3기존 ERM에 비해 TERM이 분산 감소를 통해 일반화 성능을 얼마나 향상시킬 수 있는가?
  • RQ4존재하는 방법들이 한정된 문제에만 대응하는 데 반해, TERM이 동시에 공정성과 강건성을 해결할 수 있는가?
  • RQ5강건 학습, 공정성, 불균형 분류 분야에서 TERM은 최신 기술 대비 실증적으로 어떻게 성능을 발휘하는가?

주요 결과

  • t = -2로 설정한 TERM은 높은 노이즈 수준(예: 80% 손상)에서 회귀 및 분류 작업에서 이상치를 효과적으로 억제하며, Huber 손실 및 CRR보다 뛰어난 성능을 보였다.
  • 공정한 주성분 분석(fair PCA) 분야에서 TERM은 전문적 방법에 비해 경쟁력 있거나 뛰어난 성능을 달성했으며, 하위군 간 격리 감소를 동시에 유지했다.
  • 불균형 분류에서 TERM은 적응적 t 조정을 통해 포칼 손실(Focal Loss) 및 LearnReweight의 성능을 따라하거나 능가했으며, 특히 높은 노이즈 및 불균형 조건에서 유의미한 성능 향상을 보였다.
  • 양수 t 값으로 설정한 TERM은 선형 SVM 실험에서 조정된 결정 경계를 통해 분산 감소를 통해 일반화 성능 향상을 보였다.
  • 프레임워크는 동시에 여러 과제(예: 공정성과 강건성)를 성공적으로 해결했으며, 단일 목적의 솔루션을 뛰어넘는 유연성을 입증했다.
  • 실증 결과에 따르면 TERM은 초모수 선택에 대해 강건하며, 스트로스틱 1차 최적화 방법을 통해 효율적으로 최적화될 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.