Skip to main content
QUICK REVIEW

[논문 리뷰] Wasserstein Distributionally Robust Optimization and Variation Regularization

Rui Gao, Xi Chen|arXiv (Cornell University)|2017. 12. 17.
Risk and Portfolio Optimization인용 수 12
한 줄 요약

이 논문은 워샤르슈타인 분포로 불리한 최적화(DRO)와 총 변화, 리프시츠, 기울기 정규화를 일반화하는 새로운 형태의 정규화인 변화 정규화 사이의 일반적인 연결을 수립한다. 유클리드 공간과 비유클리드 공간에서 비볼록 및 비연속 손실 함수에 대해 넓은 범위의 경우에 대해 워샤르슈타인 DRO가 작은 오차 항을 제외하고 점점 정규화와 동치임을 증명하며, 이는 적대적로 부스러운 학습에 대한 새로운 일반화 보장을 제공한다.

ABSTRACT

Wasserstein distributionally robust optimization (DRO) has recently achieved empirical success for various applications in operations research and machine learning, owing partly to its regularization effect. Although connection between Wasserstein DRO and regularization has been established in several settings, existing results often require restrictive assumptions, such as smoothness or convexity, that are not satisfied for many problems. In this paper, we develop a general theory on the variation regularization effect of the Wasserstein DRO - a new form of regularization that generalizes total-variation regularization, Lipschitz regularization and gradient regularization. Our results cover possibly non-convex and non-smooth losses and losses on non-Euclidean spaces. Examples include multi-item newsvendor, portfolio selection, linear prediction, neural networks, manifold learning, and intensity estimation for Poisson processes, etc. As an application of our theory of variation regularization, we derive new generalization guarantees for adversarial robust learning.

연구 동기 및 목표

  • 워샤르슈타인 DRO의 경험적 성공과 비볼록, 비연속, 비유클리드 설정에서의 정규화 효과 사이의 이론적 격차를 메우기 위해.
  • 기존의 정규화 형태인 총 변화 및 기울기 정규화를 통합하고 확장하는 변화 정규화의 일반 이론을 개발하기 위해.
  • 최소한의 가정 하에 워샤르슈타인 DRO와 변화 정규화 사이의 점근적 동치성을 확립하기 위해, 특히 1-워샤르슈타인 DRO에 대해서도.
  • 손실 함수의 국소 기울기의 라데마처 복잡도와 연결하여 적대적 강건 학습에 대한 새로운 일반화 경계를 유도하기 위해.
  • 기존의 동치 결과를 조각별로 연속적이고 비볼록인 손실 함수의 더 넓은 클래스로 확장하기 위해.

제안 방법

  • 손실 함수의 변화를 정의한다: 데이터 분포의 소규모 워샤르슈타인 편향 하에서 기대 손실의 최대 변화로 정의한다.
  • p ∈ (1, ∞]인 p-워샤르슈타인 DRO에 대해, 강건 최적화 문제가 점점 정규화 문제와 동치이며 나머지 항이 d²ᵖ 순서임을 증명한다.
  • 1-워샤르슈타인 DRO에 대해, 상한과 하한이 조정된 조정 파rameter를 가진 변화 정규화 항으로 둘러싸인 샌드위치 경계를 확립한다.
  • 실제 변화를 고도로 근사하기 위해, 하한 등급성 성질을 사용한다.
  • 이론을 적용하여 적대적 강건 학습의 일반화 경계를 도출하며, 경험적 및 인구 적대적 위험 간 격차가 손실 함수의 국소 기울기의 라데마처 복잡도에 의해 결정됨을 보여준다.
  • 다양한 설정에 적용 가능함을 보여주며, 다중 품목 뉴스베이더, 포트폴리오 선택, 신경망, 다양체 학습, 점과정정밀도 추정 등에 적용된다.

실험 결과

연구 질문

  • RQ1워샤르슈타인 DRO는 부드럽거나 볼록 손실을 초월하여 일반적인 정규화 형태와 이론적으로 연결될 수 있는가?
  • RQ2비연속 및 비볼록 설정에서 워샤르슈타인 DRO와 변화 정규화 사이의 정확한 관계는 무엇인가?
  • RQ3워샤르슈타인 순서 p의 선택이 정규화 효과에 어떻게 영향을 미치는가, 특히 p < 2 및 p = 2일 경우에 대해?
  • RQ4변화 정규화 이론이 적대적 강건 학습에 대해 새로운 일반화 보장을 제공할 수 있는가?
  • RQ5기존의 동치 결과가 실패할 경우, 1-워샤르슈타인 DRO 프레임워크는 여전히 변화를 제어하는가?

주요 결과

  • p ∈ (1, ∞]인 경우, 워샤르슈타인 DRO는 나머지 항이 d²ᵖ 순서인 변화 정규화와 점점 동치이며, p < 2일 경우 이는 날카로운 경계이다.
  • p = 2인 경우, 다중 품목 뉴스베이더, 조각별 선형 유틸리티를 가진 포트폴리오 선택, 그리고 리키 ReLU 네트워크와 같은 핵심 적용 분야에서 동치성이 성립한다.
  • 1-워샤르슈타인 DRO의 경우, 샌드위치 정리에 의해 강건 손실을 최소화하는 것이 변화를 제어함을 보여주며, 정확한 동치성이 실패하더라도 성립한다.
  • 적대적 강건 학습에서의 일반화 오차는 전통적인 R=(F) 항 외에도 손실 함수의 국소 기울기의 라데마처 복잡도 R=(|mF|)에 의해 제한된다.
  • 이론은 비유클리드 공간으로까지 확장되며, 다양체 학습에서 라플라시안 정규화와 포isson 과정에서 점수 함수 정규화를 통해 이를 입증하였다.
  • 기존의 1-워샤르슈타인 DRO에 대한 동치 결과를 일반화하고 강화하여, 이제 비볼록 및 비연속 손실 함수를 포함한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.