Skip to main content
QUICK REVIEW

[논문 리뷰] The Responsible Foundation Model Development Cheatsheet: A Review of Tools & Resources

Shayne Longpre, Stella Biderman|arXiv (Cornell University)|2024. 06. 24.
Geotechnical Engineering and Soil Stabilization인용 수 4
한 줄 요약

이 논문은 데이터 수급, 모델 훈련, 평가, 배포를 아우르는 250개 이상의 도구와 자원을 담은 '책임 있는 기초 모델 개발 체크리스트'를 소개한다. 윤리적, 다국어, 다중 모odal 지원 측면에서의 핵심 격차를 규명하며, 텍스트, 시각, 청각 모odal리티 전반에 걸쳐 책임 있는 기초 모델 개발을 이끄는 데 있어 투명성, 재현 가능성, 시스템 수준 평가의 중요성을 강조한다.

ABSTRACT

Foundation model development attracts a rapidly expanding body of contributors, scientists, and applications. To help shape responsible development practices, we introduce the Foundation Model Development Cheatsheet: a growing collection of 250+ tools and resources spanning text, vision, and speech modalities. We draw on a large body of prior work to survey resources (e.g. software, documentation, frameworks, guides, and practical tools) that support informed data selection, processing, and understanding, precise and limitation-aware artifact documentation, efficient model training, advance awareness of the environmental impact from training, careful model evaluation of capabilities, risks, and claims, as well as responsible model release, licensing and deployment practices. We hope this curated collection of resources helps guide more responsible development. The process of curating this list, enabled us to review the AI development ecosystem, revealing what tools are critically missing, misused, or over-used in existing practices. We find that (i) tools for data sourcing, model evaluation, and monitoring are critically under-serving ethical and real-world needs, (ii) evaluations for model safety, capabilities, and environmental impact all lack reproducibility and transparency, (iii) text and particularly English-centric analyses continue to dominate over multilingual and multi-modal analyses, and (iv) evaluation of systems, rather than just models, is needed so that capabilities and impact are assessed in context.

연구 동기 및 목표

  • AI 응용 프로그램과 기여자 수의 급격한 증가에 따라 책임 있는 기초 모델 개발의 필요성이 증가하고 있음을 반영하여 대응한다.
  • 데이터 수급부터 배포에 이르기까지 전체 모델 개발 라이프사이클을 아우르는 도구와 자원을 체계적으로 조사하고 정리한다.
  • 윤리적 데이터 처리, 다국어 및 다중 모달 지원, 재현 가능한 평가 측면에서 현재 관행의 핵심 격차를 부각시킨다.
  • 문서화된 도구와 지침을 통해 투명성, 환경 인식, 책임 있는 배포 관행을 촉진한다.
  • 평가 워크플로에 실제 환경, 가드레일, 사용자 상호작용을 통합하여 단순한 모델 테스트에서 벗어나 전체 시스템을 평가하도록 유도한다.

제안 방법

  • 데이터 소스, 준비, 훈련, 평가, 환경 영향, 모델 배포를 포함한 10개의 개발 단계에서 250개 이상의 도구와 자원을 체계적으로 수집했다.
  • 모델 개발 라이프사이클에 부합하는 체계적인 프레임워크로 도구를 정리하였으며, 데이터, 모델, 배포 단계에 전용 섹션을 마련했다.
  • 윤리적 데이터 감사, 다국어 데이터 지원, 시스템 수준 평가 등 미충족된 영역를 식별하기 위해 기존 도구들을 비판적으로 검토했다.
  • 초기 및 지속적인 문서화, 오픈 소스 평가 스크립트, 환경 영향 추적을 권장함으로써 문서화, 재현 가능성, 투명성을 강조했다.
  • 배포 환경, 입력/출력 필터, 사용자 인터페이스 고려 사항을 평가 워크플로에 통합함으로써 시스템 수준 평가를 주장했다.
  • 학계, 산업계, 오픈소스 커뮤니티에서 활동하는 25개 이상의 연구자 및 기관의 기여를 활용하여 광범위한 커버리지와 신뢰성을 확보했다.

실험 결과

연구 질문

  • RQ1기본 모델 개발 전반에 걸쳐 데이터, 훈련, 평가, 배포를 뒷받침할 수 있는 현재 가용한 도구와 자원는 무엇인가?
  • RQ2윤리적 데이터 수급, 다국어 및 다중 모달 데이터, 시스템 수준 평가 분야에서 도구의 핵심 격차는 어디에 있는가?
  • RQ3기본 모델 개발에서 투명성, 재현 가능성, 환경 영향을 어떻게 더 잘 지원할 수 있는가?
  • RQ4기존의 모델 안전성, 능력, 환경 영향 평가가 왜 자주 재현 불가능하고 투명하지 않은가?
  • RQ5실제 환경에서의 평가를 위해 단순한 모델 테스트에서 전체 시스템 평가로의 전환을 위해 어떤 변화가 필요한가?

주요 결과

  • 윤리적 요구와 실제 환경 요구를 충족하지 못하는 도구들이 데이터 수급, 모델 평가, 모니터링 분야에서 심각하게 부족한 편이다. 특히 다국어 및 다중 모달 환경에서 두드러진다.
  • 모델 안전성, 능력, 환경 영향 평가에서 재현 가능성과 투명성이 떨어지며, 많은 평가가 폐쇄 소스 평가 스크립트를 공개하지 않는다.
  • 텍스트 및 영어 중심의 분석이 지배적이며, 다국어 및 다중 모달 데이터와 평가 도구의 부족함이 뚜렷하다.
  • 실제 환경, 가드레일, 사용자 상호작용을 평가 파이프라인에 통합함으로써 단순한 모델 평가를 넘어서 전체 시스템 평가가 절실하게 필요하다.
  • 환경 영향 추정 및 자원 효율적 사용은 여전히 지원이 부족하며, 세밀한 데이터 센터 수준 및 소비자 수준의 대시보드 접근성이 제한적이다.
  • 현재 생태계는 의료나 법적 분야와 같은 수직 응용 분야에 맞는 사례 중심의 자연주의적 평가보다 일반 목적 도구를 우선시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.