[논문 리뷰] Achieving Robustness to Aleatoric Uncertainty with Heteroscedastic Bayesian Optimisation
이 논문은 입력에 따라 변하는 앨레이토릭 불확실성을 모델링하고 최소화하기 위해 이방성 가우시안 프로세스 서rogate와 두 가지 새로운 확보 함수인 이방성 확장 기대 개선도(HAEI) 및 앨레이토릭 노이즈 보상 기대 개선도(ANPEI)를 사용하는 이방성 베이지안 최적화 프레임워크를 제안한다. 이 방법은 실질적 과학 데이터셋과 시뮬레이션 데이터셋에서 동질성 베이지안 최적화와 무작위 샘플링보다 뛰어나며, 고노이즈 영역을 명시적으로 보상함으로써 자료 및 약물 발견 응용 분야에서의 강인성을 향상시킨다.
Bayesian optimisation is a sample-efficient search methodology that holds great promise for accelerating drug and materials discovery programs. A frequently-overlooked modelling consideration in Bayesian optimisation strategies however, is the representation of heteroscedastic aleatoric uncertainty. In many practical applications it is desirable to identify inputs with low aleatoric noise, an example of which might be a material composition which consistently displays robust properties in response to a noisy fabrication process. In this paper, we propose a heteroscedastic Bayesian optimisation scheme capable of representing and minimising aleatoric noise across the input space. Our scheme employs a heteroscedastic Gaussian process (GP) surrogate model in conjunction with two straightforward adaptations of existing acquisition functions. First, we extend the augmented expected improvement (AEI) heuristic to the heteroscedastic setting and second, we introduce the aleatoric noise-penalised expected improvement (ANPEI) heuristic. Both methodologies are capable of penalising aleatoric noise in the suggestions and yield improved performance relative to homoscedastic Bayesian optimisation and random sampling on toy problems as well as on two real-world scientific datasets. Code is available at: \url{https://github.com/Ryan-Rhys/Heteroscedastic-BO}
연구 동기 및 목표
- 실제 과학 응용 분야에서 이방성 앨레이토릭 불확실성이 존재할 경우 베이지안 최적화의 강인성 부족 문제를 해결하기 위해.
- 설계 공간 전역에서 입력 의존적 노이즈를 명시적으로 캡처하는 서rogate 모델을 개발하기 위해.
- 고앨레이토릭 노이즈 영역을 보상함으로써 강인하고 낮은 노이즈 솔루션을 우선시하는 확보 함수를 도입하기 위해.
- 이방성 노이즈가 존재하는 시뮬레이션 및 실제 과학 데이터셋에서 동질성 베이지안 최적화와 무작위 샘플링보다 향상된 성능을 입증하기 위해.
- 재현 가능성과 과학적 최적화 분야에서의 광범위한 채택을 위해 오픈소스 구현을 제공하기 위해.
제안 방법
- 블랙박스 함수의 평균과 분산을 동시에 모델링하는 이방성 가우시안 프로세스(GP) 서rogate 모델을 사용한다.
- 확장 기대 개선도(AEI) 히우리즘을 이방성 설정에 적응시켜 이방성 확장 기대 개선도(HAEI) 확보 함수를 도출한다.
- 예측된 노이즈 분산이 높은 예측을 명시적으로 보상하는 앨레이토릭 노이즈 보상 기대 개선도(ANPEI) 확보 함수를 도입한다.
- 이방성 GP의 예측 분산을 활용하여 입력 공간의 저노이즈, 고성능 영역으로의 탐색을 이끌어낸다.
- 이방성 GP에서 근사 사후 추론을 위해 변분 추론을 사용하여 확장 가능하고 미분 가능한 최적화를 가능하게 한다.
- 이중 단계 최적화 전략을 적용한다: 먼저 확보 함수를 최적화하고, 그 다음 선택된 점에서 블랙박스 함수를 평가한다.
실험 결과
연구 질문
- RQ1입력 공간 전역에서 앨레이토릭 노이즈가 변할 경우, 이방성 GP 서rogate 모델이 베이지안 최적화의 강인성을 향상시킬 수 있는가?
- RQ2ANPEI 확보 함수가 동질성 베이지안 최적화와 무작위 샘플링보다 저노이즈, 고성능 입력을 더 잘 식별하는가?
- RQ3자유롭게 접근 가능한 솔루션(FreeSolv) 및 토양 인산염 데이터셋과 같이 알려진 이방성 노이즈를 가진 실제 과학 데이터셋에서 제안된 방법의 성능은 어떠한가?
- RQ4진짜 노이즈 구조가 알려져 있거나 잘못 기술된 경우, 이방성 서rogate를 사용할 경우 어떤 영향을 미치는가?
- RQ5이방성 모델링에서 얻는 성능 향상은 동질성 및 노이즈 없는 설정을 포함한 다양한 노이즈 제어 환경에서 강인한가?
주요 결과
- ANPEI 확보 함수는 시뮬레이션 이방성 문제에서 동질성 베이지안 최적화와 무작위 샘플링보다 유의미하게 뛰어나며, 저노이즈, 고성능 영역으로의 수렴 속도가 빠르게 나타난다.
- FreeSolv 데이터셋에서 제안된 방법은 계산 노이즈가 낮은 분자 조성물을 성공적으로 식별하여 가상 스크리닝에서의 강인성을 향상시켰다.
- 토양 인산염 데이터셋에서 이방성 GP 모델은 동질성 모델보다 입력 의존적 노이즈를 더 잘 캡처했으며, 고노이즈 영역에서 과도한 자신감을 보이지 않았다.
- 제거 분석 결과, 이방성 서rogate를 사용하더라도 동질성 또는 노이즈 없는 작업에서 성능 저하가 발생하지 않아 모델 잘못 설정에 대한 강인성을 입증했다.
- GitHub에 공개된 오픈소스 구현은 재현 가능성을 보장하며, 자료 및 약물 발견 파이프라인에서의 채택을 촉진한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.