[논문 리뷰] Towards Trustworthy and Aligned Machine Learning: A Data-centric Survey with Causality Perspectives
이 종합 검토는 신뢰할 수 있는 기계 학습을 강건성, 적대적 강건성, 공정성 및 해석 가능성의 측면에서 통합하기 위해 데이터 중심적이고 원인관계 기반의 프레임워크를 제안한다. 펠의 원인관계 계층 구조에 기반하여 기존 기법들을 매핑함으로써 공통된 방법론적 패턴을 드러내고, 대규모 미리 훈련된 모델과의 원칙적인 통합을 가능하게 하여 더 신뢰할 수 있고 일관성 있는 AI 시스템을 구축하는 데 통합적인 접근을 제공한다.
The trustworthiness of machine learning has emerged as a critical topic in the field, encompassing various applications and research areas such as robustness, security, interpretability, and fairness. The last decade saw the development of numerous methods addressing these challenges. In this survey, we systematically review these advancements from a data-centric perspective, highlighting the shortcomings of traditional empirical risk minimization (ERM) training in handling challenges posed by the data. Interestingly, we observe a convergence of these methods, despite being developed independently across trustworthy machine learning subfields. Pearl's hierarchy of causality offers a unifying framework for these techniques. Accordingly, this survey presents the background of trustworthy machine learning development using a unified set of concepts, connects this language to Pearl's causal hierarchy, and finally discusses methods explicitly inspired by causality literature. We provide a unified language with mathematical vocabulary to link these methods across robustness, adversarial robustness, interpretability, and fairness, fostering a more cohesive understanding of the field. Further, we explore the trustworthiness of large pretrained models. After summarizing dominant techniques like fine-tuning, parameter-efficient fine-tuning, prompting, and reinforcement learning with human feedback, we draw connections between them and the standard ERM. This connection allows us to build upon the principled understanding of trustworthy methods, extending it to these new techniques in large pretrained models, paving the way for future methods. Existing methods under this perspective are also reviewed. Lastly, we offer a brief summary of the applications of these methods and discuss potential future aspects related to our survey. For more information, please visit http://trustai.one.
연구 동기 및 목표
- 강건성, 적대적 강건성, 공정성 및 해석 가능성의 측면에서 분산된 신뢰할 수 있는 기계 학습 기법의 개발 문제를 해결하기 위해 통합 원칙을 규명하는 것.
- 신뢰성 문제를 모델 아키텍처 문제에서 벗어나 데이터 구조 문제로 재정의함으로써, 유사 상관관계와 혼동 요인의 역할을 강조하는 것.
- 펠의 원인관계 계층을 통합 프레임워크로 삼아, 신뢰할 수 있는 기계 학습 기법과 원인관계 이론 간의 원칙적인 연결 고리를 구축하는 것.
- 표준 경험적 리스크 최소화(ERM)와 원인관계 추론을 연결하여, 대규모 미리 훈련된 모델에 대한 신뢰할 수 있는 기법의 적용 범위를 확장하는 것.
- 강건성, 공정성, 해석 가능성 및 적대적 강건성을 동시에 갖춘 모델을 구축할 수 있는 기회를 규명하는 것.
제안 방법
- 분포 이동 하에서 모델 실패의 근본 원인으로 유사 특징, 혼동 요인 및 데이터셋 편향을 규명함으로써, 신뢰할 수 있는 기계 학습 문제를 데이터 중심적 관점에서 재정의하는 것.
- 강건성, 적대적 강건성, 공정성 및 해석 가능성 분야의 기존 기법들을 펠의 원인관계 계층의 세 수준인 연관성, 간섭, 반사적 추론에 매핑하는 것.
- 후방 조정, do-계산법, 치료 효과 분석과 같은 원인관계 추론 도구를 적용하여 유사 상관관계를 완화하고 모델 일반화 능력을 향상시키는 것.
- 반사적 데이터 생성 및 외생 변수에 대한 간섭을 통해 시각-언어 작업에서 특히 모델의 강건성과 공정성을 향상시키는 것.
- 프롬프트 튜닝, 파라미터 효율적 미세조정, RLHF와 같은 현대적 대규모 모델 기법과 원인관계 기반 기법을 통합하여 대규모 모델의 신뢰할 수 있는 적응을 가능하게 하는 것.
- 원인관계 이론에 기반한 통합 수학적 어휘를 제안하여 다수의 신뢰할 수 있는 기계 학습 기법 간의 연결 고리를 만들고, 영역 간 전이와 원칙적인 설계를 가능하게 하는 것.
실험 결과
연구 질문
- RQ1강건성, 공정성, 해석 가능성 및 적대적 강건성의 측면에서 분산된 신뢰할 수 있는 기계 학습 기법들을 통합할 수 있는 프레임워크를 어떻게 수립할 수 있는가?
- RQ2펠의 원인관계 계층을 통해 분석했을 때, 기존의 신뢰할 수 있는 기계 학습 기법들이 어느 정도 수렴하는가?
- RQ3원인관계 기반 기법을 체계적으로 적용하여 대규모 미리 훈련된 모델의 신뢰성을 향상시킬 수 있는가?
- RQ4신뢰할 수 있는 기계 학습의 공통된 방법론적 패턴은 무엇이며, 이는 모델 신뢰성에 대한 보편적인 데이터 중심 접근을 시사하는가?
- RQ5원인관계 기반 기법은 어떻게 동시에 네 가지 신뢰할 수 있는 특성(강건성, 공정성, 해석 가능성, 적대적 강건성)을 갖춘 모델을 구축하는 데 기여할 수 있는가?
주요 결과
- 데이터 중심적이고 원인관계 기반의 관점에서 분석했을 때, 강건성, 적대적 강건성, 공정성 및 해석 가능성 분야의 기법들이 공통된 근본 원리를 공유하고 있음을 관찰할 수 있으며, 이는 공통된 기반 원리가 존재함을 시사한다.
- 후방 조정 및 반사적 생성과 같은 원인관계 추론 기법이 시각-언어 작업에서의 유사 상관관계를 효과적으로 완화하여 모델의 강건성과 공정성을 향상시킨다.
- CRAFT 데이터셋은 반사적 질문과 원인관계 질문의 가치를 입증하며, 깊은 추론을 위한 모델 훈련을 가능하게 하고 언어적 단서에 대한 과도한 의존도를 줄인다.
- 간섭 기반 데이터 증강과 치료 효과 모델링은 이미지 및 순차적 작업 모두에서 유사 특징에 대한 의존도를 줄여 모델 일반화 능력을 향상시킨다.
- 프롬프트 튜닝, 파라미터 효율적 미세조정, RLHF와 같은 기법을 통해 원인관계 이론을 대규모 미리 훈련된 모델에 통합함으로써, 신뢰할 수 있는 기초 모델을 구축하는 데 새로운 길을 열어 놓는다.
- 이 종합 검토는 중요한 연구 격차를 규명한다: 현재까지 존재하는 어떤 모델도 네 가지 신뢰할 수 있는 특성을 동시에 최적화하지는 못하며, 향후 모델 설계의 유망한 방향을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.