[논문 리뷰] #phramacovigilance - Exploring Deep Learning Techniques for Identifying Mentions of Medication Intake from Twitter
이 논문은 랜덤 하이퍼파ram터 서치와 사전 훈련된 워드 임베딩을 사용하여 트위터 게시물에서 개인 약물 복용 여부를 식별하기 위해 얕은 합성곱 신경망(CNN)의 스태킹 앙상블을 제안한다. 공개 데이터셋에서 최신 기술 수준의 마이크로 평균 F1 스코어 0.693을 달성하여 기존 모델보다 개인 복용, 가능성 있는 복용, 비복용 트윗을 분류하는 데서 뛰어난 성능을 보였다.
Mining social media messages for health and drug related information has received significant interest in pharmacovigilance research. Social media sites (e.g., Twitter), have been used for monitoring drug abuse, adverse reactions of drug usage and analyzing expression of sentiments related to drugs. Most of these studies are based on aggregated results from a large population rather than specific sets of individuals. In order to conduct studies at an individual level or specific cohorts, identifying posts mentioning intake of medicine by the user is necessary. Towards this objective, we train different deep neural network classification models on a publicly available annotated dataset and study their performances on identifying mentions of personal intake of medicine in tweets. We also design and train a new architecture of a stacked ensemble of shallow convolutional neural network (CNN) ensembles. We use random search for tuning the hyperparameters of the models and share the details of the values taken by the hyperparameters for the best learnt model in different deep neural network architectures. Our system produces state-of-the-art results, with a micro- averaged F-score of 0.693.
연구 동기 및 목표
- 소셜 미디어 게시물에서 개인 약물 복용 여부를 식별하기 위한 정확한 텍스트 분류 시스템을 개발하기 위해.
- 비공식적이고 노이즈가 많은 트위터 텍스트에서 단순 언급과 개인 복용을 구분하는 데 도전하는 데.
- 소셜 미디어 데이터를 활용하여 개인 수준 또는 코hort별 건강 모니터링을 가능하게 하여 약물 감시를 향상시키기 위해.
- 향상된 성능을 위해 새로운 스태킹 앙상블의 얕은 CNN을 설계하고 훈련하기 위해.
- 재현 가능성과 향후 연구를 위해 훈련된 모델과 최적의 하이퍼파ram터를 공개하기 위해.
제안 방법
- 공개된 트위터 데이터셋에서 표준 CNN, 다중 채널 CNN, BLSTM, CNN+BLSTM 등의 딥 뉴럴 네트워크 아키텍처를 훈련시켰다.
- 분류 성능 향상을 위해 얕은 CNN 앙상블의 스태킹 앙상블을 설계했다.
- 학습률, 드롭아웃, 필터 크기, 필터 수, 임베딩 유형 등의 하이퍼파ram터 서치를 위해 무작위 서치를 사용했다.
- 다중 채널 모델에서 다양한 구성으로 사전 훈련된 워드 임베딩(Godin, Shin, GloVe)을 사용했다.
- 5겹 교차 검증을 사용하여 모델을 최적화하고, 보류된 테스트 세트에서 평가했다.
- 검증 세트에서 F1 스코어 기반으로 가장 우수한 성능을 낸 모델을 선정하고, 그 하이퍼파aram터를 상세히 보고했다.
실험 결과
연구 질문
- RQ1딥 러닝 모델은 짧고 비공식적인 트위터 게시물에서 개인 약물 복용 여부를 효과적으로 분류할 수 있는가?
- RQ2얕은 CNN 앙상블의 스태킹 앙상블은 개인 약물 언급을 식별하는 데 있어 표준 딥 러닝 아키텍처보다 어떻게 비교되는가?
- RQ3이 분류 작업에 최적의 성능을 내는 하이퍼파라미터 구성은 무엇인가?
- RQ4랜덤 서치는 이 저자원, 노이즈가 많은 NLP 작업의 하이퍼파라미터를 효과적으로 튜닝하는 데 유용한가?
- RQ5제안된 모델은 SMM4H 공동 과제의 최신 기술 수준 시스템과 어떻게 비교되는가?
주요 결과
- 제안된 얕은 CNN 앙상블의 스태킹 앙상블은 마이크로 평균 F1 스코어 0.693을 달성하여 테스트된 모든 다른 모델보다 뛰어난 성능을 보였다.
- 가장 우수한 성능을 낸 모델은 훈련 F1+2 스코어 0.725와 테스트 F1+2 스코어 0.693를 기록했다.
- 랜덤 서치는 높은 성능을 낸 하이퍼파라미터 구성들을 성공적으로 식별했으며, 최적의 값으로는 학습률 0.0001, 드롭아웃 0.4–0.9, 필터 크기 [1,2,3,4,5] 또는 [2,3,3,3,4] 가 포함되었다.
- Godin 임베딩과 필터 크기 [1,2,3,4,5]를 사용한 다중 채널 CNN은 테스트 F1+2 스코어 0.6866를 기록했다.
- SMM4H 공동 과제에서 다른 최신 기술 수준의 모델들, 즉 UKNLP(F1: 0.689)와 NRC-Canada(F1: 0.668)를 모두 능가하는 성능을 보였다.
- 저자들은 재현 가능성과 향후 연구를 위해 모든 훈련된 모델과 최적의 하이퍼파라미터 구성 정보를 공개했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.