[論文レビュー] A hybrid deep-learning approach for complex biochemical named entity recognition
本稿では、BERT、Bi-LSTM、マルチヘッドアテンション、およびCRFを組み合わせたハイブリッドディープラーニングモデルを提案し、複雑なバイオケミカルエンティティの名前付きエンティティ認識(NER)を向上させる。このアプローチは、特に省略語、多義語、低頻度語において顕著な精度向上を達成し、2つのベンチマークデータセットにおいてBILSTM-CRFに対して80%および21.69%の相対的向上を達成した。
Named entity recognition (NER) of chemicals and drugs is a critical domain of information extraction in biochemical research. NER provides support for text mining in biochemical reactions, including entity relation extraction, attribute extraction, and metabolic response relationship extraction. However, the existence of complex naming characteristics in the biomedical field, such as polysemy and special characters, make the NER task very challenging. Here, we propose a hybrid deep learning approach to improve the recognition accuracy of NER. Specifically, our approach applies the Bidirectional Encoder Representations from Transformers (BERT) model to extract the underlying features of the text, learns a representation of the context of the text through Bi-directional Long Short-Term Memory (BILSTM), and incorporates the multi-head attention (MHATT) mechanism to extract chapter-level features. In this approach, the MHATT mechanism aims to improve the recognition accuracy of abbreviations to efficiently deal with the problem of inconsistency in full-text labels. Moreover, conditional random field (CRF) is used to label sequence tags because this probabilistic method does not need strict independence assumptions and can accommodate arbitrary context information. The experimental evaluation on a publicly-available dataset shows that the proposed hybrid approach achieves the best recognition performance; in particular, it substantially improves performance in recognizing abbreviations, polysemes, and low-frequency entities, compared with the state-of-the-art approaches. For instance, compared with the recognition accuracies for low-frequency entities produced by the BILSTM-CRF algorithm, those produced by the hybrid approach on two entity datasets (MULTIPLE and IDENTIFIER) have been increased by 80% and 21.69%, respectively.
研究の動機と目的
- 多義語、特殊文字、一貫性のないラベル付けを伴う複雑なバイオケミカル名前付きエンティティを認識する課題に対処すること。
- バイオメディカルテキストにおける省略語、多義語、低頻度エンティティの認識精度を向上させること。
- 文脈埋め込みと順序モデリング、アテンションメカニズムを統合した耐障害性の高いNERフレームワークを構築すること。
- 公開利用可能なバイオケミカルNERデータセットにおいて、既存の最先端手法を上回ること。
提案手法
- 入力テキストから文脈に応じた単語表現を抽出するためにBERTを活用する。
- トークン系列における順序的依存関係をモデル化し、長距離の文脈を捉えるためにBi-LSTMを採用する。
- ドキュメントまたはチャプター単位での表現学習を強化するためにマルチヘッドアテンション(MHATT)を統合する。
- 独立性仮定を緩和したシーケンスタグ予測のために条件付きランダムフィールド(CRF)を適用する。
- BERT、Bi-LSTM、MHATT、およびCRFを統合したエンドツーエンドのディープラーニングアーキテクチャとして統合する。
- エンティティ認識性能を最適化するために、公開利用可能なバイオケミカルNERデータセット上でモデルを訓練する。
実験結果
リサーチクエスチョン
- RQ1BERT、Bi-LSTM、およびマルチヘッドアテンションを組み合わせたハイブリッドディープラーニングモデルは、複雑なバイオケミカルエンティティのNER性能を向上させることができるか?
- RQ2提案手法は、既存の手法と比較して省略語の認識においてどのように性能を発揮するか?
- RQ3モデルは多義語および低頻度エンティティの認識をどの程度向上させるか?
- RQ4アテンション強化埋め込みとCRFを統合することで、標準のCRFやBi-LSTM-CRF設定よりも優れたシーケンスラベリングが達成できるか?
主な発見
- ハイブリッドモデルは、最先端手法と比較して2つのベンチマークデータセット(MULTIPLEおよびIDENTIFIER)で最高の認識性能を達成した。
- MULTIPLEデータセットでは、BILSTM-CRFに対して低頻度エンティティの認識精度が80%向上した。
- IDENTIFIERデータセットでは、BILSTM-CRFに対して低頻度エンティティ認識で21.69%の相対的向上を達成した。
- マルチヘッドアテンション機構は、曖昧な省略語の解消能力を顕著に向上させた。
- CRFレイヤーは長距離依存関係を効果的に捉え、独立性仮定を緩和することでシーケンスラベリングを改善した。
- BERTとBi-LSTM、MHATTの統合により、希少で複雑なエンティティにおいて優れた文脈表現学習が実現した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。