Skip to main content
QUICK REVIEW

[논문 리뷰] Missing Information, Unresponsive Authors, Experimental Flaws: The Impossibility of Assessing the Reproducibility of Previous Human Evaluations in NLP

Anja Belz, Craig Thomson|arXiv (Cornell University)|2023. 05. 02.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 NLP 분야의 인간 평가 재현 가능성에 대해 조사하며, 유의미한 정보와 낮은 재현 장벽을 제공하는 연구는 단 13%에 불과하다는 것을 발견한다. 광범위한 데이터 누락, 저자 응답 불가, 실험 설계 결함로 인해 연구자들은 직접 재현을 포기하고, 향후 인간 평가 연구의 신뢰성과 일관성을 향상시키기 위해 '표준화한 후 두 번 재현하는' 접근 방식을 제안한다.

ABSTRACT

We report our efforts in identifying a set of previous human evaluations in NLP that would be suitable for a coordinated study examining what makes human evaluations in NLP more/less reproducible. We present our results and findings, which include that just 13\% of papers had (i) sufficiently low barriers to reproduction, and (ii) enough obtainable information, to be considered for reproduction, and that all but one of the experiments we selected for reproduction was discovered to have flaws that made the meaningfulness of conducting a reproduction questionable. As a result, we had to change our coordinated study design from a reproduce approach to a standardise-then-reproduce-twice approach. Our overall (negative) finding that the great majority of human evaluations in NLP is not repeatable and/or not reproducible and/or too flawed to justify reproduction, paints a dire picture, but presents an opportunity for a rethink about how to design and report human evaluations in NLP.

연구 동기 및 목표

  • coordinated reproduction에 적합한 연구를 식별함으로써 이전 NLP 인간 평가의 재현 가능성 평가를 목적으로 한다.
  • 누락된 정보, 응답하지 않는 저자, 실험 설계 결함이 NLP 인간 평가의 재현 가능성에 얼마나 큰 영향을 미치는지 조사한다.
  • 기존의 NLP 인간 평가 연구가 원래 조건에서 의미 있게 재현될 수 있는지 평가한다.
  • 이전 평가가 근본적인 결함과 불완전한 보고로 인해 대부분 재현 불가능하다는 것을 발견한 후 연구 접근 방식을 재설계한다.
  • 향후 재현 가능성 연구를 위한 신뢰할 수 있는 기반을 마련하기 위해 인간 평가 설계의 문서화 기준 향상과 표준화를 촉구한다.

제안 방법

  • NLP 인간 평가의 재현 가능성에 영향을 미치는 요인을 체계적으로 평가하기 위해 다중 실험실, 다중 테스트(Multi-Lab, Multi-Test, MLMT) 연구 설계를 시행하였다.
  • 키워드 검색을 통해 'human evaluation'과 'participants'를 포함한 177개의 NLP 논문을 선별하였다.
  • 참가자 유형, 수, 지침, 평가 척도, 출력 세트 등의 정보를 추출하기 위해 논문 수준 및 실험 수준의 상세한 주석 작업을 수행하였다.
  • 특히 실험 설정 및 훈련 절차에 대한 누락 또는 모호한 정보를 확보하기 위해 저자들과 다수의 소통 라운드를 진행하였다.
  • 일관되지 않은 평가 척도, 명확하지 않은 지침, 항목 제시 시 랜덤화 누락 등의 실험 설계 결함을 식별하고 기록하였다.
  • 재현 불가 및 기본 결함으로 인해 직접 재현이 불가능하다고 판단되어, 방법론적 일관성을 확보하기 위해 '표준화한 후 두 번 재현하는' 접근 방식을 채택하였다.

실험 결과

연구 질문

  • RQ1이전 NLP 인간 평가 중 얼마나 많은 비율이 재현 가능하도록 충분한 정보와 낮은 장벽을 갖추고 있는가?
  • RQ2누락된 정보, 응답하지 않는 저자, 실험 설계 결함이 얼마나 NLP 인간 평가의 재현 가능성에 영향을 미치는가?
  • RQ3실험 설계 결함이 인간 평가 연구 재현 시도의 의미에 어떤 영향을 미치는가?
  • RQ4직접 재현이 불가능할 경우 어떤 대체 방법론적 접근 방식을 사용할 수 있는가?
  • RQ5향후 NLP 분야의 인간 평가 재현 가능성 향상을 위해 보고 기준과 실험 설계에 어떤 변화가 필요한가?

주요 결과

  • 분석 대상 177개의 NLP 논문 중 단 13%만이 재현 가능하도록 충분히 낮은 장벽과 확보 가능한 정보를 갖추고 있었다.
  • 재현을 위한 선택된 실험들 중 유일한 예외를 제외한 전부가 재현 시도의 의미를 의심스럽게 만들 정도의 결함을 포함하고 있었다.
  • 참가자 수, 참가자 유형, 훈련 지침, 평가 세트와 같은 핵심 요소가 각각 37, 59, 15篇의 논문에서 누락되거나 모호하게 기재되어 있었다.
  • 저자들과의 광범위한 소통에도 불구하고, 일부 사례에서는 핵심 실험 정보가 확보되지 않았으며, 특히 모국어 사용자 요구 여부 및 출력의 랜덤화 방식에 대한 정보가 누락된 바 있었다.
  • 재현 불가 및 결함이 만연한 평가가 널리 퍼져 있어, 연구는 원래의 직접 재현 설계를 포기할 수밖에 없었다.
  • 연구자들은 현재 NLP 분야의 인간 평가 보고 방식은 신뢰할 수 있는 재현 가능성을 확보하기에 부족하다고 결론 내리며, 재현 이전에 표준화되고 사전 처리된 평가 설계가 필요하다고 주장하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.