[논문 리뷰] Representation Bias in Data: A Survey on Identification and Resolution Techniques
이 종합적 서베이는 구조적 및 비구조적 데이터에서의 표현 편향에 대한 포괄적인 분석을 제시하며, 텍스트, 표준, 이미지, 그래프 데이터 간에 식별 및 해결 기법을 비교 분석합니다. 데이터 수준의 편향—표본 추출, 역사적 요인 또는 구조적 요인으로 인한 부족한 표현—이 모델 훈련 이전에 해결되어야 하며, 이는 공정한 AI 결과를 보장하기 위함입니다.
Data-driven algorithms are only as good as the data they work with, while data sets, especially social data, often fail to represent minorities adequately. Representation Bias in data can happen due to various reasons ranging from historical discrimination to selection and sampling biases in the data acquisition and preparation methods. Given that "bias in, bias out", one cannot expect AI-based solutions to have equitable outcomes for societal applications, without addressing issues such as representation bias. While there has been extensive study of fairness in machine learning models, including several review papers, bias in the data has been less studied. This paper reviews the literature on identifying and resolving representation bias as a feature of a data set, independent of how consumed later. The scope of this survey is bounded to structured (tabular) and unstructured (e.g., image, text, graph) data. It presents taxonomies to categorize the studied techniques based on multiple design dimensions and provides a side-by-side comparison of their properties. There is still a long way to fully address representation bias issues in data. The authors hope that this survey motivates researchers to approach these challenges in the future by observing existing work within their respective domains.
연구 동기 및 목표
- 모델 수준의 공정성에만 초점을 맞추는 것 외에 데이터 수준의 표현 편향에 초점을 맞춤으로써 공정성 연구의 핵심적 격차를 메우기 위해.
- 구조적(표준) 및 비구조적(텍스트, 이미지, 그래프) 데이터에서 표현 편향을 식별하고 해결하기 위한 체계적인 분류 체계를 제공하기 위해.
- 데이터 유형, 편향 유형, 개입 단계(식별 대비 해결)와 같은 설계 차원을 기반으로 기존 방법들을 비교하기 위해.
- 스트리밍 데이터, 시공간 데이터, 향상된 편향 측정 지표 등에 대한 열린 과제를 부각시켜 향후 연구를 촉진하기 위해.
- 모델 훈련 이전에 공정한 데이터 관행을 장려함으로써 데이터 중심 AI의 개발을 지원하기 위해.
제안 방법
- 데이터 유형, 편향 원인, 개입 전략을 기반으로 표현 편향 탐지 및 완화 기법을 분류하는 다차원 분류 체계를 제안함.
- 측정된 소그룹 커버리지, 표현 비율, 그래프 내 동질성(호모필리) 등을 포함한 식별 기법과 데이터 재가중, 임베딩 편향 제거, 그래프 구조 수정 등을 포함한 해결 기법으로 방법을 분류함.
- 성별/인종 벡터에 수직으로 투영함으로써 단어 임베딩을 편향 제거하는 기법과, 그래프 학습에서 무작위 보행을 수정하여 공정성을 향상시키는 기법을 분석함.
- 소수 집단의 표현 부족을 정량화하기 위해 커버리지 및 표현 비율 같은 지표를 도입함.
- 전이 확률을 조정하거나 간선을 제거함으로써 동질성 감소를 목표로 하는 Fairwalk 및 Fairdrop 같은 방법을 평가함.
- 표현 공간에서 편향을 명시적으로 모델링함으로써 공정한 그래프 임베딩을 학습하기 위한 베이지안 및 조합적 접근법을 검토함.
실험 결과
연구 질문
- RQ1표준, 텍스트, 이미지, 그래프 데이터를 포함한 다양한 데이터 유형에서 표현 편향을 체계적으로 식별하는 방법은 무엇인가요?
- RQ2기존 기법들 간을 구분하는 데 핵심이 되는 설계 차원은 무엇인가요? (예: 데이터 유형, 편향 유형, 개입 단계)
- RQ3임베딩 편향 제거 또는 그래프 구조 수정과 같은 현재의 해결 기법들이 소수 집단의 표현 부족을 얼마나 효과적으로 완화하는가요?
- RQ4커버리지 및 표현 비율과 같은 기존 지표들은 표현 편향의 심각성을 어떻게 측정하며, 그 한계는 무엇인가요?
- RQ5스트리밍 또는 시공간 데이터와 같이 새로운 데이터 유형으로 표현 편향 탐지 및 해결을 확장할 때의 열린 과제는 무엇인가요?
주요 결과
- 역사적, 표본 추출, 구조적 요인으로 인해 실세계 데이터에서 표현 편향이 광범위하게 존재하며, 이는 표현이 부족한 소그룹의 일반화 능력을 떨어뜨립니다.
- 균일한 표본 추출이라도, 타겟 인구에서 기저 발생 빈도가 낮은 소수 집단(예: 임신 중인 개인)은 여전히 표현이 부족합니다.
- 성별/인종 벡터에 수직으로 투영함으로써 단어 임베딩을 편향 제거하는 기법은 자연어 처리에서 고정관념적 연관성을 크게 감소시킵니다.
- 그래프 데이터에서는 Fairdrop 및 Fairwalk과 같은 기법이 인접 행렬 또는 전이 확률을 수정함으로써 동질성을 감소시켜 노드 표현의 공정성을 향상시킵니다.
- 표현 비율 및 커버리지 같은 지표는 유용하지만, 복잡하거나 동적인 데이터에서는 세밀한 편향 패턴을 포착하는 데 한계가 있습니다.
- 스트리밍 및 시공간 데이터와 같은 분야에서는 편향 역학이 시간에 따라 변화하므로, 새로운 지표와 확장 가능한 솔루션이 여전히 필수적입니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.