Skip to main content
QUICK REVIEW

[논문 리뷰] Opening the Software Engineering Toolbox for the Assessment of Trustworthy AI

Mohit Kumar Ahuja, Mohamed-Bachir Belaid|arXiv (Cornell University)|2020. 07. 14.
Adversarial Robustness in Machine Learning참고 문헌 24인용 수 6
한 줄 요약

이 논문은 신뢰할 수 있는 AI 평가에 기존 소프트웨어 공학 기법—특히 테스트, 요구사항 분석, 자동 모니터링—을 통합할 것을 제안한다. 유럽 AI HLEG의 일곱 가지 핵심 신뢰성 요구사항을 기존 소프트웨어 공학 기법에 대응시켜, 저자들은 소프트웨어 공학 도구상자가 체계적이고 반복 가능하며 이해관계자들이 접근 가능한 방식으로 AI 시스템의 신뢰성에 대한 평가에 있어 성숙하고 확장 가능하며 유연한 기반을 제공할 수 있음을 입증한다.

ABSTRACT

Trustworthiness is a central requirement for the acceptance and success of human-centered artificial intelligence (AI). To deem an AI system as trustworthy, it is crucial to assess its behaviour and characteristics against a gold standard of Trustworthy AI, consisting of guidelines, requirements, or only expectations. While AI systems are highly complex, their implementations are still based on software. The software engineering community has a long-established toolbox for the assessment of software systems, especially in the context of software testing. In this paper, we argue for the application of software engineering and testing practices for the assessment of trustworthy AI. We make the connection between the seven key requirements as defined by the European Commission's AI high-level expert group and established procedures from software engineering and raise questions for future work.

연구 동기 및 목표

  • 실제 응용 분야에서 AI의 신뢰성에 대한 체계적이고 반복 가능하며 투명한 평가 수요 증가에 대응하기 위해.
  • 현대 AI 시스템이 초래하는 고유한 과제—특히 공정성, 책임성, 해석 가능성—와 현재 소프트웨어 공학 기법 간 격차를 규명하기 위해.
  • 요구사항 분석, 자동 테스트, 모니터링과 같은 소프트웨어 공학 방법을 신뢰할 수 있는 AI 개발 라이프사이클에 통합하는 프레임워크를 제안하기 위해.
  • 비전문가 포함 이해관계자들이 표준화되고 정량화된 평가 지표와 배지 기반으로 AI의 신뢰성을 평가하고 이해할 수 있도록 하기 위해.

제안 방법

  • EU AI HLEG 지침의 일곱 가지 핵심 신뢰성 요구사항을 요구사항 공학, 코드 리뷰, 테스트 케이스 설계와 같은 소프트웨어 공학 기법에 대응시키는 맵핑 작업.
  • 기술적 내구성 평가를 위해 자동 테스트 기법을 적용하며, 이는 악성 입력에 대한 내성과 극단적 상황에서의 모델 행동을 포함한다.
  • 공정성 및 책임성과 같은 추상적인 신뢰성 원칙을 검증 가능한 조건으로 구현하기 위해 체크리스트와 형식화된 수락 기준을 사용한다.
  • 코드 및 데이터 리뷰, 후속 회의, 인스트루멘티드 로깅을 통한 지속적 모니터링을 개발 과정에 통합하여 신뢰성 지표를 추적한다.
  • 신뢰성 평가 결과를 요약하기 위한 점수 또는 배지 시스템을 제안하여 다양한 이해관계자 간 비교 가능성과 투명성을 확보한다.
  • 블록체인 기술을 활용해 AI 시스템 내 데이터 소유권, 감사 가능성, 책임성을 지원할 잠재적 메커니즘으로 활용한다.

실험 결과

연구 질문

  • RQ1유럽 AI HLEG에서 정의한 바와 같이 AI 시스템의 신뢰성 평가에 기존 소프트웨어 공학 기법을 효과적으로 적응시킬 수 있는가?
  • RQ2자동 테스트 및 모니터링 도구는 공정성, 내구성, 책임성과 같은 비기능적 AI 성질을 평가하는 데 어느 정도 활용될 수 있는가?
  • RQ3현대 AI의 고유한 특성—예를 들어 블랙박스 모델과 데이터 기반 행동—을 고려할 때 현재 소프트웨어 공학 툴링에 어떤 조정이 필요한가?
  • RQ4비기술적 이해관계자, 즉 최종 사용자 및 규제 기관이 신뢰성 평가 결과를 접근 가능하고 이해할 수 있도록 하는 방법은 무엇인가?
  • RQ5표준화된 점수 또는 인증 메커니즘(예: 배지)이 AI 간 시스템 간 비교 및 신뢰 형성에 어떤 역할을 할 수 있는가?

주요 결과

  • 테스트, 요구사항 분석, 모니터링을 포함한 소프트웨어 공학 도구상자는 신뢰할 수 있는 AI 평가에 성숙하고 재사용 가능한 기반을 제공한다.
  • 기술적 내구성, 공정성과 같은 많은 신뢰성 요구사항은 자동 테스트 케이스 및 악성 입력 생성을 통해 평가할 수 있다.
  • 신뢰성 기준을 체크리스트와 검증 가능한 수락 기준으로 형식화하면 평가의 재현성 향상과 모호성 감소에 기여한다.
  • 코드 및 데이터 리뷰, 후속 평가를 통한 지속적 모니터링은 개발 과정에서의 신뢰성 인식 향상과 개선을 지원한다.
  • 표준화된 점수 또는 배지 시스템은 다양한 AI 시스템과 이해관계자 간의 신뢰성 평가 투명성과 비교 가능성 향상에 기여할 수 있다.
  • 블록체인 기반 시스템은 개인 정보 및 동의 관리와 관련된 시나리오에서 데이터 소유권 및 책임성을 실현하는 데 잠재력을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.