Skip to main content
QUICK REVIEW

[논문 리뷰] Offline Model-Based Optimization via Normalized Maximum Likelihood Estimation

Justin Fu, Sergey Levine|arXiv (Cornell University)|2021. 02. 16.
Adversarial Robustness in Machine Learning참고 문헌 32인용 수 8
한 줄 요약

이 논문은 데이터 분포 외 입력에 대해 불확실성 인식 및 보수적인 예측을 생성하기 위해 정규화된 최대우도(NML) 추정기의 처리 가능한 근사값을 사용하는 새로운 오프라인 모델 기반 최적화 방법인 NEMO를 제안한다. NML의 불확실성에 대한 원리적인 처리 방식을 활용함으로써 NEMO는 모델 유용성 문제를 피하고 재료 과학, 생물학, 로봇공학 분야의 다양한 오프라인 최적화 작업에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In this work we consider data-driven optimization problems where one must maximize a function given only queries at a fixed set of points. This problem setting emerges in many domains where function evaluation is a complex and expensive process, such as in the design of materials, vehicles, or neural network architectures. Because the available data typically only covers a small manifold of the possible space of inputs, a principal challenge is to be able to construct algorithms that can reason about uncertainty and out-of-distribution values, since a naive optimizer can easily exploit an estimated model to return adversarial inputs. We propose to tackle this problem by leveraging the normalized maximum-likelihood (NML) estimator, which provides a principled approach to handling uncertainty and out-of-distribution inputs. While in the standard formulation NML is intractable, we propose a tractable approximation that allows us to scale our method to high-capacity neural network models. We demonstrate that our method can effectively optimize high-dimensional design problems in a variety of disciplines such as chemistry, biology, and materials engineering.

연구 동기 및 목표

  • 표준 프록시 모델이 분포 내 데이터에 과적합되어 분포 외 입력을 악용하는 공격적인 입력을 생성하는 오프라인 모델 기반 최적화에서의 모델 유용성 문제를 해결한다.
  • 추가 기능 쿼리 없이도 분포 외 입력으로 안정적으로 일반화할 수 있는 확장 가능한 불확실성 인식 전방 모델을 개발한다.
  • 정보 이론 원리를 활용해 고차원, 데이터가 부족한 최적화 문제에서의 불확실성 추정에 원리적인 방법을 제공한다.
  • 기능 평가가 비용이 많이 들고 안전이 중요한 실세계 환경, 예를 들어 재료 설계, 단백질 공학, 신경망 아키텍처 탐색에서 강건한 최적화를 가능하게 한다.
  • 고차원 환경에서 정규화된 최대우도(NML) 추정기의 비처리 가능성 문제를 해결하기 위해 처리 가능한 약간의 근사값을 도입한다.

제안 방법

  • 불확실성과 분포 이동을 내재적으로 고려하는 원리적인 전방 모델로 조건부 NML(CNML) 분포를 제안한다.
  • 처리하기 어려운 NML 추정기의 처리 가능한 신경망 기반 근사값을 도입하여 고차원 입력과 복잡한 기능 공간으로의 확장성을 확보한다.
  • 추론 시 효율적으로 NML 분포를 근사하는 학습된 파rameterized 모델을 통해 NML 추정의 계산 비용을 보상한다.
  • 결과적으로 도출된 불확실성 인식 모델을 후행 최적화 파이프라인에서 보수적인 대체 목적 함수로 사용하여 추가 기능 평가 없이도 강건한 설계 탐색을 가능하게 한다.
  • NEMO 예측 분포를 기반으로 입자 배치를 최적화하여 다양한 오프라인 최적화 작업에 적용한다.
  • 표준 최적화 알고리즘과 NEMO 모델을 통합하여 고신뢰도의 분포 외 인식 설계를 생성한다.

실험 결과

연구 질문

  • RQ1처리 가능한 NML 추정기 근사값이 오프라인 모델 기반 최적화에서 모델 유용성을 효과적으로 완화할 수 있는가?
  • RQ2NEMO의 불확실성 추정이 기존 방법(예: 앙상블 또는 베이지안 신경망)에 비해 분포 외 입력으로 일반화되는 정도는 어떠한가?
  • RQ3NEMO가 실제 고차원 설계 문제에서 최신 기술 수준의 오프라인 최적화 베이스라인을 얼마나 뛰어넘을 수 있는가?
  • RQ4특히 데이터가 적은 환경에서 NML의 이론적 손실 경계가 실질적으로 유지되는가?
  • RQ5NEMO 프레임워크는 고성능 신경망 모델에 효과적으로 스케일링되어 재료, 생물학 및 로봇공학 분야의 실용적 응용에 활용될 수 있는가?

주요 결과

  • Superconductor 작업에서 NEMO는 100번째 백분위수 점수 127.0 ± 7.292를 기록하여 다음으로 우수한 방법(앙상블: 88.01 ± 10.43)과 데이터셋 최대값(73.90)을 크게 초월했다.
  • GFP 작업에서 NEMO는 100번째 백분위수 점수 3.359 ± 0.036를 기록하여 데이터셋 최대값 3.152와 모든 베이스라인을 능가했다.
  • HopperController 작업에서 NEMO는 100번째 백분위수 점수 2130.1 ± 506.9를 기록하여 데이터셋 최대값 1361.6를 크게 상회했다.
  • 50번째 백분위수 평가에서 NEMO는 Superconductor에서 66.41 ± 4.618을 기록하여 GP-BO(72.42 ± 0.000)와 모든 다른 베이스라인을 능가했다.
  • 정성적 분석 결과 NEMO는 합리적인 불확실성 추정을 생성하는 반면, 앙상블은 데이터가 적은 환경에서 과신된 잘못된 예측을 내놓는 것으로 나타났다.
  • 절단 실험 결과 NML 근사값이 프록시 함수에 직접 최적화하는 것보다 성능을 크게 향상시킴으로써 불확실성 인식 모델링의 필요성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.