[논문 리뷰] Industry-Scale Orchestrated Federated Learning for Drug Discovery
이 논문은 IMI MELLODDY 프로젝트 내에서 개발된 산업 규모의 연합 학습 플랫폼을 제시하며, 민감한 데이터를 공유하지 않고도 10개의 제약회사가 공동으로 글로벌 약물 발견 모델을 훈련할 수 있도록 한다. AWS에서 암호화 기법을 활용해 모델 기울기를 안전하게 집계함으로써, 모든 파트너에서 AUC-PR 기준 4% 향상, 활성도 예측 기준 2% 향상, 적용 영역 기준 10% 향상된 예측 성능을 달성하여, 약물 발견 분야에서 확장 가능하고 개인정보 보호 기능을 갖춘 인공지능의 실현 가능성을 입증한다.
To apply federated learning to drug discovery we developed a novel platform in the context of European Innovative Medicines Initiative (IMI) project MELLODDY (grant n°831472), which was comprised of 10 pharmaceutical companies, academic research labs, large industrial companies and startups. The MELLODDY platform was the first industry-scale platform to enable the creation of a global federated model for drug discovery without sharing the confidential data sets of the individual partners. The federated model was trained on the platform by aggregating the gradients of all contributing partners in a cryptographic, secure way following each training iteration. The platform was deployed on an Amazon Web Services (AWS) multi-account architecture running Kubernetes clusters in private subnets. Organisationally, the roles of the different partners were codified as different rights and permissions on the platform and administrated in a decentralized way. The MELLODDY platform generated new scientific discoveries which are described in a companion paper.
연구 동기 및 목표
- 약물 발견의 높은 실패율과 R&D 비용을 줄이기 위해 협업 학습을 통해 모델 성능을 향상시키는 것.
- 제약 산업에서 기업들이 기밀 화합물 및 시험 데이터를 공유하지 않는다는 점에서 발생하는 데이터 기밀성 및 기밀 보장 장벽을 극복하는 것.
- 중앙 집중식 데이터 융합 없이도 다수 기업 간 협업을 가능하게 하는 확장성 있고 안전하며 생산 환경에 적합한 연합 학습 인프라를 개발하는 것.
- 실제 산업 현장에서 연합 학습이 QSAR 모델의 예측 정확도와 적용 영역 확장성에 어떻게 기여하는지 입증하는 것.
- 감염성 분야인 약물 발견 분야에서의 다자간 협업을 위한 탈중앙화되고 권한 기반의 거버넌스 모델을 구축하는 것.
제안 방법
- 개인 정보 보호를 위한 프라이빗 서브넷에 배치된 컨테이너 기반의 Kubernetes 클러스터를 활용해 AWS의 다중 계정 아키텍처를 구축하여 연합 학습 플랫폼을 운영했다.
- 원시 데이터 폭로 없이도 모델 업데이트를 공유할 수 있도록 암호화 기반의 기울기 집계 프로토콜을 구현했다.
- 세분화된 권한을 통해 조직 역할과 접근 권한을 명확히 정의하여 10개 파트너 간 탈중앙화된 관리 구조를 실현했다.
- 중앙 서버에는 c5n.18xlarge 인스턴스, 클라이언트 워커에는 r5n.2xlarge 인스턴스를 사용하여 통신 및 메모리 병목 현상을 관리했다.
- 수렴성과 확장성을 고려해 20개의 훈련 에포크와 라운드당 50~80개의 미니배치를 사용한 연합 평균 기반의 학습을 적용했다.
- 모델의 불확실성을 정량화하고 적용 영역 확장 정도(델타 메디안 컨 formal 효율성)를 측정하기 위해 공식적 예측 기법을 활용했다.
실험 결과
연구 질문
- RQ1약물 발견 분야의 다기관, 다파트너 환경에서 데이터 기밀성에 손상이 가지 않도록 하면서도 연합 학습을 어떻게 확장할 수 있는가?
- RQ2단일 기업 모델 대비 연합 학습이 QSAR 모델링에서 예측 성능을 얼마나 향상시키는가?
- RQ3연합 학습 모델은 개별 파트너 모델 대비 적용 영역을 얼마나 넓힐 수 있는가?
- RQ4대규모 연합 학습에서 주요 컴퓨팅 병목 현상(예: 통신, 메모리)은 무엇인가?
- RQ5탈중앙화된 거버넌스 및 접근 제어 모델이 민감한 분야에서 장기적인 산업 협업을 효과적으로 지원할 수 있는가?
주요 결과
- 단일 기업 모델 대비 10만 개 이상의 머신러닝 작업에서 평균적으로 AUC-PR이 4% 향상된 것으로 확인되었다.
- 델타 메디안 컨포멀 효율성으로 측정된 적용 영역이 10% 증가하여 새로운 화합물 구조에 대해 신뢰할 수 있는 예측이 가능해졌다.
- 모든 파트너에서 약리학적 및 독성 활성 예측의 회귀 성능이 2% 향상되었다.
- 특히 지속적인 데이터 확보가 이루어지는 약물동역학 및 독성 시험에서 성능 향상이 두드러졌다.
- 20개 에포크와 50~80개의 미니배치를 사용한 안정적인 훈련이 가능했으며, 구성에 따라 훈련 시간은 1.7~12.9시간으로 변동했다.
- 모든 10개 제약 기업 파트너가 실질적인 이점을 확인했으며, 내부 약물 발견 파이프라인에 모델 통합을 위한 의지를 표명했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.