Skip to main content
QUICK REVIEW

[論文レビュー] Identification of Outlying Observations with Quantile Regression for Censored Data

Soo‐Heang Eo, Seung‐Mo Hong|arXiv (Cornell University)|Apr 30, 2014
Advanced Statistical Methods and Models参考文献 1被引用数 5
ひとこと要約

本稿では、右打ち切りを伴う生存データに対して、打ち切り分位数回帰を用いた3つの外れ値検出アルゴリズム—残差ベース、ボックスプロット、スコアリング—を提案する。スコアリングアルゴリズムは、外れ値の大きさスコアを提供し、視覚的なしきい値選択を可能にするため、感度と特異度のバランスに優れるとしてデフォルトとして推奨される。これらの手法は、CRANで利用可能なRパッケージOutlierDCに実装されている。

ABSTRACT

Outlying observations, which significantly deviate from other measurements, may distort the conclusions of data analysis. Therefore, identifying outliers is one of the important problems that should be solved to obtain reliable results. While there are many statistical outlier detection algorithms and software programs for uncensored data, few are available for censored data. In this article, we propose three outlier detection algorithms based on censored quantile regression, two of which are modified versions of existing algorithms for uncensored or censored data, while the third is a newly developed algorithm to overcome the demerits of previous approaches. The performance of the three algorithms was investigated in simulation studies. In addition, real data from SEER database, which contains a variety of data sets related to various cancers, is illustrated to show the usefulness of our methodology. The algorithms are implemented into an R package OutlierDC which can be conveniently employed in the \proglang{R} environment and freely obtained from CRAN.

研究の動機と目的

  • 医学的および疫学的研究における打ち切りを伴う生存データに対する頑健な外れ値検出手法の不足を解消すること。
  • 外れ値に対して頑健で、非正規分布および打ち切りが一般的に見られる生存解析の文脈で有効なアルゴリズムを開発すること。
  • 解釈可能な外れ値の大きさスコアを提供し、視覚的かつ柔軟な外れ値検出を可能にすること。
  • 実世界のデータ解析における実用的利用を可能にする、アクセスしやすいRパッケージへの実装を図ること。
  • 結果を歪める影響力のある観測値を同定することで、生存データ解析の信頼性を向上させること。

提案手法

  • 外れ値に対して頑健であるよう、生存時間の条件付き分位数をモデル化するために打ち切り分位数回帰を用いる。
  • 打ち切り分位数回帰からの残差を計算し、スケール補正されたしきい値を適用することで、残差ベースの検出を適応する。
  • 残差の四分位範囲を用いた修正されたボックスプロットルールを適用し、極端な観測値を同定する。
  • 各観測値に対して外れ値の大きさスコアを計算するスコアリングアルゴリズムを導入し、視覚的なしきい値選択を可能にする。
  • 局所加重打ち切り分位数回帰(Wang, 2008)を、データのフィッティングに用いる基本モデルとする。
  • すべてのアルゴリズムをRパッケージOutlierDCに実装し、感度と特異度のバランスに優れるスコアリング法をデフォルトとして採用する。

実験結果

リサーチクエスチョン

  • RQ1従来の手法が非正規性と打ち切りのため失敗する、打ち切りを伴う生存データにおける外れ値検出を効果的に行う方法は何か?
  • RQ2残差ベース、ボックスプロット、スコアリングのうち、どの外れ値検出アルゴリズムが打ち切りデータにおいて感度と特異度のバランスに優れているか?
  • RQ3外れ値の大きさを定量化するスコアリングベースのアプローチは、固定しきい値に比べてしきい値選択を改善できるか?
  • RQ4提案されたアルゴリズムは、SEERデータベースの実際のがん生存データおよびシミュレーションスタディにおいて、どのように性能を発揮するか?
  • RQ5打ち切り分位数回帰を用いることで、影響力のある観測値の同定における頑健性はどの程度向上するか?

主な発見

  • シミュレーションスタディにおいて、スコアリングアルゴリズムが感度と特異度のバランスにおいて残差ベースおよびボックスプロット手法を上回った。
  • 残差ベースのアルゴリズムは高い感度を示したが、その分、特異度が低かった。
  • ボックスプロットアルゴリズムはk_b = 1.5の場合、1つの外れ値しか検出しなかった。これは感度が低く、特異度が高いことを示している。
  • しきい値k_s = 4.0を用いたスコアリングアルゴリズムは、2つの外れ値(327番目および346番目)を検出しており、他の手法と一貫した結果を示した。
  • 346番目の観測値は、3つのアルゴリズムすべてで外れ値として同定されたため、検出の整合性が確認された。
  • OutlierDC Rパッケージは、3つのアルゴリズムを正常に実装しており、実用性を考慮し、スコアリング法をデフォルトとして採用した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。