Skip to main content
QUICK REVIEW

[논문 리뷰] Group-driven Reinforcement Learning for Personalized mHealth Intervention

Feiyun Zhu, Jun Guo|arXiv (Cornell University)|2017. 08. 14.
Mobile Health and mHealth Applications참고 문헌 18인용 수 5
한 줄 요약

이 논문은 행동 유사성 기반으로 사용자를 군집화하고 각 군집 내에서 공유 정책을 학습함으로써 개인화된 mHealth 간섭을 위한 그룹 기반 강화학습(RL) 프레임워크를 제안한다. 유사한 사용자 간의 데이터 공유를 균형 있게 유지하면서도 충분한 개별 학습을 보장함으로써, 장기 평균 보상에서 기존 최고 수준의 방법 대비 최대 82.4단계 향상된 성능을 달성한다. 이는 사용자 데이터가 제한된 경우 尤히 두드러진다.

ABSTRACT

Due to the popularity of smartphones and wearable devices nowadays, mobile health (mHealth) technologies are promising to bring positive and wide impacts on people's health. State-of-the-art decision-making methods for mHealth rely on some ideal assumptions. Those methods either assume that the users are completely homogenous or completely heterogeneous. However, in reality, a user might be similar with some, but not all, users. In this paper, we propose a novel group-driven reinforcement learning method for the mHealth. We aim to understand how to share information among similar users to better convert the limited user information into sharper learned RL policies. Specifically, we employ the K-means clustering method to group users based on their trajectory information similarity and learn a shared RL policy for each group. Extensive experiment results have shown that our method can achieve clear gains over the state-of-the-art RL methods for mHealth.

연구 동기 및 목표

  • 기존 mHealth RL 방법이 완전한 사용자 동질성 또는 완전한 이질성에 기반한다는 점의 한계를 해결한다.
  • 사용자를 일부는 유사하고 일부는 유사하지 않은 존재로 보는 더 현실적인 프레임워크를 개발한다.
  • 데이터 복잡성 감소와 각 학습 군집당 샘플 수 증가 사이의 균형을 이룬다.
  • mHealth 응용에서 흔한 낮은 데이터 환경에서 정책의 안정성과 성능을 향상시킨다.
  • 군집 기반 정책 학습에서 잘못된 군집 수 추정에 대한 강건성을 입증한다.

제안 방법

  • 사용자의 행동 궤적 데이터 간 유사성 기반으로 K-means 군집화를 적용하여 사용자를 군집화한다.
  • 각 군집 내에서 가용한 모든 데이터를 사용해 공유 딥 Q-네트워크 정책을 학습한다.
  • 가치 함수 추정을 위해 선형 함수 근사 기반의 액터-크리틱 RL 프레임워크를 사용한다: $ Q_{\mathbf{w}} = \mathbf{w}^T \mathbf{x}(s,a) $.
  • 기대 수익 최적화를 위해 기준 상태 분포 $ d_{\text{ref}}(s) $ 와 정책 파rameter화 $ \pi_\theta(a|s) $ 를 사용한다.
  • 목표 함수 $ \widehat{J}(\theta) = \sum_s d_{\text{ref}}(s) \sum_a \pi_\theta(a|s) Q^{\pi_\theta}(s,a) $ 에 대해 확률적 경사상승법을 사용해 정책을 훈련한다.
  • 50명의 사용자, 5개의 군집, 다양한 궤적 길이(T=42, T=100)를 가진 시뮬레이션 데이터를 사용하고, K=3 및 K=7 군집으로 테스트하여 강건성 평가를 수행한다.

실험 결과

연구 질문

  • RQ1행동 유사성 기반 군집화가 동질성 모델이나 완전히 독립적인 모델 대비 RL 기반 mHealth 간섭의 성능을 향상시키는가?
  • RQ2진짜 사용자 군집 수가 알려지지 않았거나 잘못 추정되었을 때, 제안된 그룹 기반 RL 방법의 성능은 어떠한가?
  • RQ3개별 사용자 데이터가 제한된 짧은 궤적 조건에서도 이 방법이 성능을 유지하는가?
  • RQ4군집 수(K)의 선택이 정책 성능와 강건성에 어떤 영향을 미치는가?
  • RQ5군집 기반 지식 공유가 mHealth 응용에서 정책 분산을 얼마나 줄이고 장기 보상 향상에 기여하는가?

주요 결과

  • 궤적 길이가 짧을 경우(T=42), 제안된 그룹 기반 RL(Gr-RL) 방법이 가장 성능이 뛰어난 베이스라인(Separ-RL) 대비 장기 평균 보상(ElrAR) 평균 82.4단계 향상되었다.
  • 더 긴 궤적 길이(T=100) 조건에서는 Gr-RL이 기존 최고 수준의 방법보다 ElrAR 기준 49.8에서 51.7단계 향상되어 일관된 성과를 보였다.
  • K=3 및 K=7 군집 조건에서 Gr-RL은 유사하게 높은 성능을 보이며 일관된 상위 성능을 기록하여 잘못된 군집 수 추정에 강건함을 입증했다.
  • 궤적 길이가 길어질수록 성능 향상 폭이 감소함을 확인하여, 데이터가 풍부한 환경에서는 군집 기반 학습의 상대적 이점이 감소함을 시사했다.
  • 짧은 궤적에서는 작은 K 값(K=3 등)이 데이터 강화에 유리했고, 긴 궤적에서는 큰 K 값(K=7 등)이 군집당 데이터를 단순화하여 더 효과적이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.