Skip to main content
QUICK REVIEW

[논문 리뷰] How to Stop Epidemics: Controlling Graph Dynamics with Reinforcement Learning and Graph Neural Networks.

Eli A. Meirom, Haggai Maron|arXiv (Cornell University)|2020. 10. 11.
Complex Network Analysis Techniques참고 문헌 57인용 수 7
한 줄 요약

이 논문은 전염병이나 오락성 정보 확산과 같은 동적이고 부분 관측 가능한 그래프 프로세스에서 노드 테스트 우선순위를 정하기 위해 그래프 신경망을 사용하는 강화학습 프레임워크인 RLGN을 제안한다. 이는 효율적인 확산 차단을 가능하게 한다. 동일한 자원을 사용할 때, 지도학습 기반 방법보다 25% 더 많은 건강한 개체를 확보하고, 비학습 기반 기준보다 30% 높은 차단 성공률을 기록하며, 자원이 동일한 조건에서 비학습 기반 기준 대비 2.5배 향상된 성능을 달성한다.

ABSTRACT

We consider the problem of monitoring and controlling a partially-observed dynamic process that spreads over a graph. This problem naturally arises in contexts such as scheduling virus tests or quarantining individuals to curb a spreading epidemic; detecting fake news spreading on online networks by manually inspecting posted articles; and targeted marketing where the objective is to encourage the spread of a product. Curbing the spread and constraining the fraction of infected population becomes challenging when only a fraction of the population can be tested or quarantined. To address this challenge, we formulate this setup as a sequential decision problem over a graph. In face of an exponential state space, combinatorial action space and partial observability, we design RLGN, a novel tractable Reinforcement Learning (RL) scheme to prioritize which nodes should be tested, using Graph Neural Networks (GNNs) to rank the graph nodes. We evaluate this approach in three types of social-networks: community-structured, preferential attachment, and based on statistics from real cellular tracking. RLGN consistently outperforms all baselines in our experiments. It suggests that prioritizing tests using RL on temporal graphs can increase the number of healthy people by $25\%$ and contain the epidemic $30\%$ more often than supervised approaches and $2.5 imes$ more often than non-learned baselines using the same resources.

연구 동기 및 목표

  • 그래프 상에서 퍼지는 동적이고 부분 관측 가능한 프로세스(예: 전염병 또는 오락성 정보 확산)를 제어하는 데 도전 과제를 해결하기 위해.
  • 그래프 구조의 의사결정 문제에서 기하급수적 상태 공간과 조합적 행동 공간을 다룰 수 있는 실용적인 강화학습 접근법을 설계하기 위해.
  • 제한된 자원으로 감염 확산을 최소화하기 위해 실시간으로 어떤 노드를 테스트하거나 격리할지 우선순위를 정하기 위해.
  • 전염병 차단 및 인구 건강 유지 측면에서 지도학습 및 비학습 기반 기준을 능가하기 위해.

제안 방법

  • 동적 그래프 상에서의 노드 테스트 및 간섭 문제를 순차적 의사결정 과정으로 공식화한다.
  • 감염 확산에 대한 잠재적 영향 기반으로 노드를 임bed하고 순위를 매기기 위해 그래프 신경망(GNN)을 활용한다.
  • 테스트 또는 격리 대상으로 높은 우선순위를 가진 노드를 선택하는 정책을 학습하기 위해 강화학습(RL)을 사용한다.
  • 시간에 따른 그래프 동적 변화와 간접 관측 자료를 기반으로 부분 관측 문제를 처리한다.
  • 최종 감염 규모 최소화 및 건강한 개체 수 최대화와 같은 장기적 결과를 최적화한다.
  • 개입 후 전염병의 최종 상태에 기반한 지연 보상을 사용하여 RL 에이전트를 훈련시킨다.

실험 결과

연구 질문

  • RQ1부분 관측 가능한 동적 그래프 프로세스에서 강화학습 에이전트가 감염 확산을 줄이기 위해 효과적으로 노드 테스트 우선순위를 정할 수 있는가?
  • RQ2강화학습 기반 접근법의 성능이 전염병 차단에서 지도학습 및 비학습 기반 기준과 비교해 어떻게 되는가?
  • RQ3복잡한 실제 그래프 구조에서 GNN이 노드 우선순위 정하기에 얼마나 기여하는가?
  • RQ4RLGN 프레임워크가 합성 및 실제 세포 추적 데이터를 포함한 다양한 네트워크 구조에 일반화되는가?

주요 결과

  • 동일한 테스트 자원 조건에서 기준 방법 대비 25% 더 많은 건강한 개체를 확보한다.
  • 지도학습 기반 기준 대비 전염병 차단 빈도가 30% 더 높다.
  • 동일한 간섭 예산을 사용할 때 비학습 기반 기준 대비 2.5배 높은 차단 성공률을 기록한다.
  • 커뮤니티 구조, 선호적 연결 및 실제 세포 추적 네트워크의 세 가지 네트워크 유형에서 모든 기준 대비 일관되게 뛰어난 성능을 보인다.
  • 부분 관측 조건과 조합적 행동 공간에서도 GNN 기반의 노드 순위 매기기 방식이 효과적인 우선순위 정하기를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.