완벽한 데이터는 없다. 데이터 이용자는 사용에 앞서 데이터 전처리(preprocessing) 과정을 거친다. 이는 데이터의 결함을 찾아 처리하는 필수적인 과정아며 데이터 품질관리 측면에서 매우 중요하다. 이 단계에서 이상치를 찾아내고 적합하게 처리한다. 이상치 관리는 데이터 자체뿐만 아니라 데이터를 사용한 결과물의 신뢰도에도 영향을 준다. 특히, 데이터를 활용한 추정치는 이상치에 민감하기 때문에 이해관계자들이 충돌할 수 있다. 따라서 매끄럽고, 슬기로운 이상치 처리가 필요하다.
이 강좌는 이상치를 탐색하고 처리하는 방법을 실무적으로 정리하였다. 특히, 빅데이터의 전처리 내용을 참고하여 계리업무가 아닌 고유한 데이터 관리관점에서 접근하였다. 이 강좌는 통계책임자, 통계담당자 그리고 통계에 관심있는 직원의 교육용으로 제작되었다.
강사 profile