Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Submodular Functions

Jeffrey A. Bilmes, Wenruo Bai|arXiv (Cornell University)|2017. 01. 31.
Machine Learning and Algorithms참고 문헌 27인용 수 20
한 줄 요약

이 논문은 딥 뉴럴 네트워크에서 영감을 받은 유연하고 계층적인 하위모듈러 함수의 새로운 가족인 딥 서브모듈러 함수(DSFs)를 소개한다. DSFs는 SCMMs를 일반화하며 깊이에 따라 엄격하게 표현 능력이 향상되며, 미분 가능한 아키텍처를 통해 하위모듈러 함수의 엔드 투 엔드 학습을 가능하게 하여 기계 학습에서 표현 학습과 최적화를 위한 새로운 클래스를 제공한다.

ABSTRACT

We start with an overview of a class of submodular functions called SCMMs (sums of concave composed with non-negative modular functions plus a final arbitrary modular). We then define a new class of submodular functions we call {\em deep submodular functions} or DSFs. We show that DSFs are a flexible parametric family of submodular functions that share many of the properties and advantages of deep neural networks (DNNs). DSFs can be motivated by considering a hierarchy of descriptive concepts over ground elements and where one wishes to allow submodular interaction throughout this hierarchy. Results in this paper show that DSFs constitute a strictly larger class of submodular functions than SCMMs. We show that, for any integer $k>0$, there are $k$-layer DSFs that cannot be represented by a $k'$-layer DSF for any $k'

연구 동기 및 목표

  • 딥 뉴럴 네트워크의 계층적이고 분산 표현 성질을 물려받는 새로운 하위모듈러 함수의 가족을 개발하기 위해.
  • 2^n개의 자유도를 가진 고차원 복잡한 데이터 공간에서 적절한 하위모듈러 함수를 선택하거나 학습하는 데 도전하는 문제를 해결하기 위해.
  • 기계 학습에서 표현 학습, 최적화, 일반화를 지원하는 딥 하위모듈러 함수에 대한 공식적 프레임워크를 수립하기 위해.
  • DSFs가 SCMMs를 엄격하게 일반화하고, 얕은 네트워크와 달리 깊이에 따라 표현 능력이 엄격하게 증가함을 보여주기 위해.
  • 미분 가능한 아키텍처를 사용하여 하위모듈러 함수의 엔드 투 엔드 학습을 가능하게 하며, 특징 매핑과 하위모듈러 함수를 함께 학습할 수 있도록 하기 위해.

제안 방법

  • DSFs를 다중 레이어를 통해 재귀적으로 조합된 함수로 정의하며, 각 레이어는 비음수 모듈러 함수에 대한 오목 함수를 적용하여 깊은 계층을 형성한다.
  • DSFs의 미분 가능성을 확보하고 연속 영역에서 기울기 기반 최적화와의 호환성을 확보하기 위해 로바슈 확장을 사용한다.
  • 하위모듈러 함수를 특징짓는 데 사용되는 반단조 초미분의 개념을 도입하고, 이를 음수의 이阶 편미분과 연속 하위모듈러성과 연결한다.
  • DNN 특징 매핑 $\tilde{h}_\theta$와 DSF $f_w$를 조합한 파라미터 기반 왜곡 거리 측정법 $d_{w,\theta}(x_i, x_j) = \breve{f}_w(\tilde{h}_\theta(x_i) + \tilde{h}_\theta(x_j) - 2\tilde{h}_\theta(x_i) \otimes \tilde{h}_\theta(x_j))$를 제안한다.
  • 특징 인코더 $\tilde{h}_\theta$와 하위모듈러 함수 매개변수 $w$를 동시에 학습하기 위한 공동 학습 목표 $J(w, \theta) = \sum_{i,j} \|d(x_i,x_j) - d_{w,\theta}(x_i,x_j)\|$를 제안한다.
  • 특히 라미너 매트로이드를 포함한 매트로이드 이론을 활용하여 DSF의 표현 능력 분석과 랭크 함수와의 비교를 위한 이론적 기초를 구축한다.

실험 결과

연구 질문

  • RQ1하위모듈러 함수의 계층적이고 깊은 아키텍처를 공식적으로 정의하고, 기존의 SCMMs와 같은 가족을 일반화할 수 있는가?
  • RQ2DSF의 레이어 수를 늘릴수록 표현 능력이 엄격하게 증가하는가? 이 깊이 기반 능력은 얕은 모델과 비교해 독특한가?
  • RQ3DSFs는 모든 하위모듈러 함수를 표현할 수 있는가, 아니면 표현 능력에 기본적인 한계가 존재하는가?
  • RQ4특히 하위모듈러 함수 값에 대한 레이블이 제공되지 않은 경우, DSFs는 어떻게 효과적으로 데이터로부터 학습할 수 있는가?
  • RQ5DSFs는 엔트로피 함수나 매트로이드 랭크 함수와 같은 다른 하위모듈러 가족과 어떤 관계가 있는가?

주요 결과

  • DSFs는 SCMMs를 엄격하게 일반화하며, 더 넓고 표현 능력이 뛰어난 하위모듈러 함수의 가족을 형성한다.
  • 모든 $k > 0$에 대해, $k'$-레이어 DSF($k' < k$)로 표현될 수 없는 $k$-레이어 DSF가 존재함을 보여, 깊이가 표현 능력을 엄격하게 증가시킴을 증명한다.
  • 백프로파게이션 스타일의 모순 추론을 통해, 모든 하위모듈러 함수의 가족은 DSF의 가족보다 엄격히 크다는 것을 입증한다. 이는 DSFs가 보편적이지 않다는 가정에서 유도된다.
  • 로바슈 확장을 통해 DSFs는 미분 가능한 최적화를 지원하며, 특징 표현과 하위모듈러 함수의 엔드 투 엔드 훈련을 가능하게 한다.
  • 공동 학습 목표 $J(w, \theta)$는 DNN 특징 매핑 $\tilde{h}_\theta$와 DSF $f_w$를 동시에 학습시켜 원래 데이터 간의 거리를 유지하는 데 기여한다.
  • 이 프레임워크는 해시 함수와 하위모듈러 함수를 동시에 학습하는 등의 응용을 가능하게 하며, 후속 작업을 위한 파라미터 기반 왜곡 거리 측정법을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.