Skip to main content
QUICK REVIEW

[論文レビュー] "Is depression related to cannabis?": A knowledge-infused model for Entity and Relation Extraction with Limited Supervision

Kaushik Roy, Usha Lokala|arXiv (Cornell University)|Feb 1, 2021
Sentiment Analysis and Opinion Mining参考文献 50被引用数 9
ひとこと要約

本論文は、GPT-3と教師付き対照学習を用いて、知識を統合した少数-shot関係抽出フレームワークを提案し、ソーシャルメディアのテキストからうつ病-カンナビス関係(理由、効果、依存)を特定する。人的アノテーションが限られているにもかかわらず、最先端のモデルを上回る性能を達成した。本手法は、薬物乱用オントロジーとDSM-5/PHQ-9語彙を活用して文脈的理解を向上させ、予測ラベルが付与された11,000件のツイートからなる高品質かつ公開可能なデータセットを生成した。

ABSTRACT

With strong marketing advocacy of the benefits of cannabis use for improved mental health, cannabis legalization is a priority among legislators. However, preliminary scientific research does not conclusively associate cannabis with improved mental health. In this study, we explore the relationship between depression and consumption of cannabis in a targeted social media corpus involving personal use of cannabis with the intent to derive its potential mental health benefit. We use tweets that contain an association among three categories annotated by domain experts - Reason, Effect, and Addiction. The state-of-the-art Natural Langauge Processing techniques fall short in extracting these relationships between cannabis phrases and the depression indicators. We seek to address the limitation by using domain knowledge; specifically, the Drug Abuse Ontology for addiction augmented with Diagnostic and Statistical Manual of Mental Disorders lexicons for mental health. Because of the lack of annotations due to the limited availability of the domain experts' time, we use supervised contrastive learning in conjunction with GPT-3 trained on a vast corpus to achieve improved performance even with limited supervision. Experimental results show that our method can significantly extract cannabis-depression relationships better than the state-of-the-art relation extractor. High-quality annotations can be provided using a nearest neighbor approach using the learned representations that can be used by the scientific community to understand the association between cannabis and depression better.

研究の動機と目的

  • ソーシャルメディアのテキストにおけるカンナビスとうつ病の間の微細な関係を抽出するためのアノテート済みデータの不足に対処すること。
  • 薬物乱用オントロジーおよびDSM-5/PHQ-9語彙からのドメイン固有の知識を統合することで、リソースが限られた環境における関係抽出のパフォーマンスを向上させること。
  • GPT-3の表現を活用して大規模な人的アノテーションに依存しない少数-shot学習アプローチを構築すること。
  • 今後の精神保健研究を支援するため、予測ラベルが付与された11,000件のツイートからなる高品質かつ公開可能なデータセットを生成すること。
  • 知識の統合が、監視が限られた特殊な精神保健分野における関係抽出のパフォーマンスを顕著に向上させることを実証すること。

提案手法

  • フレームワークは、自然言語の意味的・構文的パターンを捉えるために、ツイートの文脈的埋め込みをGPT-3で生成する。
  • ドメイン知識は、DSM-5、PHQ-9、SNOMED-CT、ICD-10、MeSH用語を統合した薬物乱用オントロジー(DAO)を用いて、エンティティおよび関係表現を豊かにする。
  • 教師付き対照学習を適用して、人的にアノテートされたツイート3,000件のみを用いてモデルを微調整し、監視が限られた状況下での一般化性能を向上させる。
  • ラベルなしのツイートは、学習済み表現を用いてクラスタリングされ、多数決投票によって関係(理由、効果、依存)にラベルが付与される。
  • 近隣探索法を用いて、信頼度の高い予測をラベルなしデータに伝搬させ、半教師あり学習を実現する。
  • 知識に配慮した損失関数をモデルアーキテクチャに統合し、関連するエンティティおよび関係の表現を一致させることで、関係タイプ間の識別性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1人的アノテーションが限られている状況でも、知識を統合したNLPモデルが最先端の関係抽出器を上回る性能を発揮できるか?
  • RQ2GPT-3の表現とドメイン知識を組み合わせることで、精神保健分野のテキストにおける少数-shot関係抽出がどの程度効果的に向上するか?
  • RQ3少数のラベル付き例しか利用できない状況で、教師付き対照学習がモデルの一般化性能をどの程度向上させるか?
  • RQ4学習済み表現をガイドとするツイート埋め込みの非教師ありクラスタリングが、3つの関係タイプ(理由、効果、依存)を正確に予測できるか?
  • RQ5医療および依存関連のオントロジーからの知識統合が、ソーシャルメディアデータにおける抽出された関係の解釈可能性と信頼性をどの程度向上させるか?

主な発見

  • 提案手法は、人的監視が限られているにもかかわらず、最先端の関係抽出器を顕著に上回る性能を発揮した。
  • 薬物乱用オントロジーにDSM-5およびPHQ-9語彙を統合することで、うつ病およびカンナビス関連の臨床用語およびスラング語の認識能力が向上した。
  • 教師付き対照学習により表現学習が向上し、t-SNEで可視化した結果、3つの関係タイプ(理由、効果、依存)にツイートが明確にクラスタリングされた。
  • クラスタリングと近隣探索によるラベル付けの組み合わせにより、11,000件のラベルなしツイートに対して高品質な予測が得られ、今後の研究に役立つ信頼性のあるデータセットが構築された。
  • t-SNEの可視化結果から、学習済み表現が3つの関係クラスを明確に分離しており、意味的役割の明確な区別が図られていることが確認された。
  • 最終的なデータセットは11,000件のツイートから構成され、うち3,000件は人的アノテーション済み、残りの8,000件は予測ラベルが付与された。このデータセットは、カンナビスとうつ病に関する再現可能な研究を支援するために公開された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。