Skip to main content
QUICK REVIEW

[논문 리뷰] Comparison of Canonical Correlation and Partial Least Squares analyses of simulated and empirical data

Anthony R. McIntosh|arXiv (Cornell University)|2021. 07. 14.
Sensory Analysis and Statistical Methods인용 수 5
한 줄 요약

이 연구는 대규모 표본 크기를 가진 시뮬레이션 및 실증 데이터셋에서 캐논리컬 공분산 분석(CCA)과 부분 최소 제곱법(PLS)을 비교하며, 표본 추출을 통해 민감도, 신뢰성 및 재현성의 정도를 평가한다. 결과적으로 CCA와 PLS는 약한에서 강한 효과 조건에서 유사하게 성능을 보이며, CCA는 블록 내 상관계수가 높을 경우 신뢰성이 저하되나, 성분 점수에 사전 PCA를 적용하면 이 문제가 완화된다. 반면 PLS는 작은 표본 크기에서도 높은 재현성을 유지한다. 이는 다변량 분석에서 유의미성뿐만 아니라 재현성까지 평가할 필요성을 시사한다.

ABSTRACT

In this paper, we compared the general forms of CCA and PLS on three simulated and two empirical datasets, all having large sample sizes. We took successively smaller subsamples of these data to evaluate sensitivity, reliability, and reproducibility. In null data having no correlation within or between blocks, both methods showed equivalent false positive rates across sample sizes. Both methods also showed equivalent detection in data with weak but reliable effects until sample sizes drop below n=50. In the case of strong effects, both methods showed similar performance unless the correlations of items within one data block were high. For PLS, the results were reproducible across sample sizes for strong effects, except at the smallest sample sizes. On the contrary, the reproducibility for CCA declined when the within-block correlations were high. This was ameliorated if a principal components analysis (PCA) was performed and the component scores used to calculate the cross-block matrix. The outcome of our examination gives three messages. First, for data with reasonable within and between block structure, CCA and PLS give comparable results. Second, if there are high correlations within either block, this can compromise the reliability of CCA results. This known issue of CCA can be remedied with PCA before cross-block calculation. This, however, assumes that the PCA structure is stable for a given sample. Third, null hypothesis testing does not guarantee that the results are reproducible, even with large sample sizes. This final outcome suggests that both statistical significance and reproducibility be assessed for any data.

연구 동기 및 목표

  • 다양한 데이터 조건 하에서 캐논리컬 공분산 분석(CCA)과 부분 최소 제곱법(PLS)의 상대적 성능을 평가하기 위해.
  • 감소하는 표본 크기 조건에서 CCA와 PLS의 민감도, 신뢰성 및 재현성 수준을 평가하기 위해.
  • 고 블록 내 상관계수가 CCA 결과에 미치는 영향을 조사하고, 이를 완화할 수 있는 방법을 탐색하기 위해.
  • 다변량 분석에서 통계적 유의미성만으로도 결과의 재현성이 보장되는지 조사하기 위해.
  • 데이터 구조와 표본 크기에 기반하여 CCA와 PLS 간의 선택 기준을 실용적으로 제시하기 위해.

제안 방법

  • 연구는 대규모 표본 크기를 가진 세 개의 시뮬레이션 데이터셋과 두 개의 실증 데이터셋에 대해 CCA와 PLS를 적용하였다.
  • 각 데이터셋으로부터 순차적인 표본을 추출하여 다양한 표본 크기 조건에서의 성능을 평가하였다.
  • 가짜 양성률을 평가하기 위해 블록 내 또는 블록 간 상관관계가 없는 근본적 데이터를 사용하였다.
  • CCA의 경우, 교차 블록 공분산 행렬을 계산하기 전에 데이터 블록에 주성분 분석(PCA)을 적용하였다.
  • 다양한 크기의 표본에서 결과를 비교하여 재현성을 평가하였다.
  • 통계적 유의미성과 재현성은 별도로 평가하여 그 상관관계를 분석하였다.

실험 결과

연구 질문

  • RQ1다양한 표본 크기 조건에서 CCA와 PLS의 통계적 검정력과 가짜 양성률은 어떻게 비교되는가?
  • RQ2고 블록 내 상관계수가 CCA 결과의 신뢰성에 미치는 영향은 PLS에 비해 어떠한가?
  • RQ3PCA 사전 처리가 고 블록 내 상관계수가 높은 조건에서 CCA의 신뢰성을 향상시킬 수 있는가?
  • RQ4CCA 또는 PLS에서 통계적 유의미성이 다양한 표본에서 결과의 재현성을 보장하는가?
  • RQ5실증 및 시뮬레이션 데이터에서 CCA와 PLS가 어떤 조건에서 유사한 결과를 도출하는가?

주요 결과

  • 상관관계가 없는 근본적 데이터에서, CCA와 PLS는 모든 표본 크기 조건에서 동일한 가짜 양성률을 보였다.
  • 약하지만 신뢰할 수 있는 효과가 있는 경우, 두 방법 모두 표본 크기가 n=50 이하로 떨어지기 이전까지는 비슷한 성능를 보였다.
  • 강한 효과 조건에서는 블록 내 상관계수가 높지 않은 한 CCA와 PLS가 비슷한 성능를 보였지만, 블록 내 상관계수가 높아지면 CCA의 신뢰성이 저하되었다.
  • PLS는 작은 표본 크기에서도 높은 재현성을 유지했으며, 가장 작은 표본 크기 이외에는 대부분의 경우에 안정된 결과를 보였다.
  • CCA는 고 블록 내 상관계수 조건에서 재현성이 저하되었지만, 교차 블록 공분산 행렬 계산 이전에 성분 점수에 PCA를 적용하면 이 문제가 완화되었다.
  • 연구 결과, 대규모 표본 크기 조건에서도 통계적 유의미성이 재현성을 보장하지는 않으며, 이는 유의미성과 재현성 모두를 평가할 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.