Skip to main content
QUICK REVIEW

[논문 리뷰] A Novel Genetic Algorithm with Hierarchical Evaluation Strategy for Hyperparameter Optimisation of Graph Neural Networks

Yingfang Yuan, Wenjun Wang|arXiv (Cornell University)|2021. 01. 22.
Machine Learning in Materials Science참고 문헌 45인용 수 11
한 줄 요약

이 논문은 그래프 신경망(GNNs)에서 하이퍼파ram터 최적화를 위한 계층적 평가 전략을 갖춘 새로운 유전 알고리즘인 HESGA를 제안한다. 이 알고리즘은 빠른 초기 정지 RMSE 차이 점수와 완전한 훈련 평가를 조합하여 계산 비용을 줄이면서도 높은 성능을 유지하며, GC 모델에서는 베이지안 최적화를 능가하고 MPNN 모델에서는 이를 맞추는 성능을 보인다. 이는 세 가지 분자의 성질 예측 벤치마크에서 확인되었다.

ABSTRACT

Graph representation of structured data can facilitate the extraction of stereoscopic features, and it has demonstrated excellent ability when working with deep learning systems, the so-called Graph Neural Networks (GNNs). Choosing a promising architecture for constructing GNNs can be transferred to a hyperparameter optimisation problem, a very challenging task due to the size of the underlying search space and high computational cost for evaluating candidate GNNs. To address this issue, this research presents a novel genetic algorithm with a hierarchical evaluation strategy (HESGA), which combines the full evaluation of GNNs with a fast evaluation approach. By using full evaluation, a GNN is represented by a set of hyperparameter values and trained on a specified dataset, and root mean square error (RMSE) will be used to measure the quality of the GNN represented by the set of hyperparameter values (for regression problems). While in the proposed fast evaluation process, the training will be interrupted at an early stage, the difference of RMSE values between the starting and interrupted epochs will be used as a fast score, which implies the potential of the GNN being considered. To coordinate both types of evaluations, the proposed hierarchical strategy uses the fast evaluation in a lower level for recommending candidates to a higher level, where the full evaluation will act as a final assessor to maintain a group of elite individuals. To validate the effectiveness of HESGA, we apply it to optimise two types of deep graph neural networks. The experimental results on three benchmark datasets demonstrate its advantages compared to Bayesian hyperparameter optimization.

연구 동기 및 목표

  • 그래프 신경망(GNNs)의 하이퍼파ram터 최적화(HPO)에 소요되는 높은 계산 비용을 해결하기 위해, 각 후보 설정에 대해 비용이 많이 드는 완전한 훈련이 수반되는 문제를 다루기 위해.
  • 훈련의 초기 단계에서의 RMSE 차이를 기반으로 한 빠른 평가 방법을 도입하여 HPO의 시간과 자원 부담을 줄이기 위해.
  • 빠른 평가를 통해 후보 선택을 이끌고 완전한 평가를 통해 우수한 개체를 유지하는 계층적 평가 전략을 개발하여 효율성과 정확성의 균형을 이루기 위해.
  • 두 가지 일반적인 GNN 아키텍처인 그래프 컨볼루션(GC)과 메시지 전파 신경망(MPNN)을 사용하여 실제 분자의 성질 예측 데이터셋에서 제안된 방법의 효과성을 검증하기 위해.
  • 제안된 방법이 계산 비용을 크게 줄이며 베이지안 최적화와 비교해도 우수하거나 유사한 성능을 달성할 수 있음을 보여주기 위해.

제안 방법

  • HESGA는 여러 세대에 걸쳐 진화하는 하이퍼파ram터 설정의 집합을 갖는 유전 알고리즘 프레임워크를 사용한다.
  • 빠른 평가 전략을 사용하여 초기 훈련 에포크와 조기 훈련 에포크(예: 훈련의 10% 이후) 사이의 RMSE 차이를 피트니스 점수의 대체 지표로 계산한다.
  • 각 세대의 후손 전체에 대해 빠른 평가를 적용하여 성능을 순위 매기고 유망한 후보를 선별한다.
  • 빠른 평가에서 상위 성능을 보인 후보들의 일부가 완전한 훈련을 거쳐 검증 세트에서의 진짜 RMSE를 계산하며, 이는 최종 선택을 위한 피트니스 점수로 사용된다.
  • 계층 전략은 오직 소수의 후보들(엘리트 비율에 의해 결정됨)만 완전한 평가를 거치도록 하여 고비용의 훈련 호출을 최소화한다.
  • 빠른 점수를 사용해 선택을 하며 완전한 점수를 사용해 우수 개체 집합을 유지함으로써 탐색과 이용의 균형을 이루며, 계산 비용은 완전한 평가와 빠른 평가의 횟수에 비례한다고 모델링한다.

실험 결과

연구 질문

  • RQ1빠른 평가와 완전한 평가를 조합한 계층적 평가 전략이 하이퍼파라미터 최적화의 계산 비용을 줄이면서도 해답의 품질을 훼손하지 않게 할 수 있는가?
  • RQ2조기 RMSE 차이를 기반으로 한 빠른 평가 방법이 GNN 설정의 최종 성능을 얼마나 정확히 예측할 수 있는가?
  • RQ3HESGA가 GNN 아키텍처에서 최종 RMSE와 계산 효율성 측면에서 베이지안 하이퍼파라미터 최적화를 능가하는가?
  • RQ4다양한 데이터셋과 GNN 모델에 적용했을 때 HESGA의 확장성은 어떠한가? 특히 다양한 훈련 비용 제약 조건 하에서의 성능는 어떻게 되는가?
  • RQ5HESGA는 모델 성능과 훈련 비용을 균형 잡는 이중 목적 최적화를 처리하는 데 확장 가능할 수 있는가?

주요 결과

  • HESGA는 ESOL, FreeSolv, Lipophilicity 데이터셋에서 그래프 컨볼루션(GC) 모델을 최적화할 때 베이지안 하이퍼파라미터 최적화(BHO)보다 뛰어난 성능을 달성했다.
  • MPNN 모델에서는 HESGA가 BHO와 비교해 유사한 성능을 보이며, 다양한 GNN 아키텍처에 걸쳐 강력한 일반화 능력을 입증했다.
  • HESGA의 계산 비용은 10개의 개체, 10세대, 100에포크로 구성된 단일 실행에서 약 3,000회의 완전한 훈련 연산(O_GC)에 해당하는 것으로 추정되었으며, 이는 전체 검색의 비용을 크게 줄였다.
  • 조기 RMSE 차이를 기반으로 한 빠른 평가 방법이 GNN의 최종 성능을 효과적으로 예측하여 정확도 손실을 최소화하면서 효율적인 후보 순위 매기기를 가능하게 했다.
  • 계층 전략은 각 세대당 전체 개체 수의 10% 이내로 완전한 평가 횟수를 줄였으며, 고품질의 해답을 유지하면서 고비용의 훈련을 최소화하는 데 성공했다.
  • 이 방법은 확장성과 적응성을 입증했으며, 대규모 환경에서의 서rogate 모델 또는 부분 데이터 훈련으로의 확장 가능성도 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.