해양환경안전학회지 Vol.26 No.7 (p.798-809)

|Research Paper|
해상안전 통계 항목 다양화를 위한 EDA 기반 통계 속성 도출 및 활용에 관한 연구

Study on the EDA based Statistics Attributes Discovery and Utilization for the Maritime Safety Statistics Items Diversification
키워드 :
EDA,증거기반행정,통계속성,정책개선,해상안전,Exploratory Data Analysis,Evidence-Based Decision-Making,Statistics Attribute,Policy Improvement,Maritime Safety

목차

요 약
Abstract
1. 서 론
2. 문헌연구
   2.1 통계 생산·활용 패러다임 변화와 빅데이터
   2.2 탐색적 데이터 분석(EDA)
   2.3. 국가통계 활용현황과 한계
3. 연구 설계
   3.1 연구 프레임워크
   3.2 문제 및 데이터 정의
4. 탐색적 데이터 분석
   4.1 텍스트 마이닝 기반 추가 속성 도출 및 데이터 수집
   4.2 데이터 파악
   4.3 속성 간 관계분석
5. 정책적 활용 방안
   5.1 수난대비기본계획 세부 전략 키워드 분석
   5.2 전략별 키워드와 EDA 도출 속성 간 매칭
6. 연구결론 및 향후 연구 과제
References

초록

과학적 행정을 위한 증거 기반 정책 수립과 평가에 대한 요구로 통계(데이터) 활용 중요성이 날로 강조되고 있다. 통계는 사회 전반의 현상을 수치로 제공함으로써 직관적으로 어떤 현상을 설명할 수 있도록 하며, 합리적인 의사결정을 위한 공공자원으로 설명된다. 이러한 특성으로 통계는 정부 정책 결정 및 각종 현상의 연구․분석 등에 기초자료이자 근거자료로 널리 활용되고 있으나 그 중요성에 비해 통계의 역할은 제한적인 수준이다. 이는 현재 개방된 통계가 단순 결과 요약 자료 수준이며 공급자 위주로 생산되어 수요자 관점에서 가치 창출을 위한 수단으로는 부족하다는 의미이며, 본 연구에서는 이러한 문제 보완을 위해 현재 제공되는 통계 항목 외에 정책이나 연구에 다양하게 활용할 수 있는 추가 속성을 탐색했다. 연구에 활용한 기준 통계자료는 해양경찰청에서 발간하는 「해상조난사고 통계 연보」이며, 해양경찰에서 작성하는 선박사고 상황보고서 텍스트 분석을 통해 추가할 수 있는 속성들을 도출했다. 텍스트 분석을 통해 도출된 56개 속성에 대해 데이터를 수집하고 EDA를 수행한 결과, 유의확률(p-value < .05)을 만족하는, 상관계수 0.7 이상의 강한 상관관계가 있는 속성 조합 18개와, 중간 정도의 상관관계(0.4 이상 0.7 미만)를 가지는 속성조합 70개, 총 88개의 조합을 발굴할 수 있었다. 더불어 EDA를 통해 발견된 추가 속성을 정책적으로 활용하기 위해 수난대비기본계획 세부 전략별 키워드 분석을 실시하고, 키워드와 EDA 도출 속성 간 매칭작업을 통해 속성의 활용 가능 여부를 검토했다.
Evidence-based policymaking and assessments for scientific administration have increased the importance of statistics (data) utilization. Statistics can explain specific phenomena by providing numerical values and are a public resource for national decision making. Due to these inherent attributes, statistics are utilized as baseline and base data for government policy determinations and the analysis of various phenomena. However, compared to the importance, the role of statistics is limited, and statistics are often used as simple abstracts, produced mainly for suppliers, not for consumers’ perspectives to create value. This study explores the statistical data and other attributes that can be utilized for policies or research to address the problems mentioned above. The baseline statistical data used in this study is from the Maritime Distress Accident Statistical Yearbook published by the South Korean Coast Guard, and other additional attributes are from text analyses of vessel casualty situation reports from the South Korean Maritime Police. Collecting 56 attributes drawn from the text analysis and executing an EDA resulted in 88 attribute unions: 18 attribute unions had a satisfactory significance probability (p-value < .05) and a strong correlation coefficient above 0.7, and 70 attribute unions had a middle correlation. (over 0.4 and under 0.7). Additionally, to utilize the extra attributes discovered from the EDA politically, a keyword analysis for each detailed strategy of the disaster Preparation basic plan was executed, the utilization availability of the attributes was obtained using a matching process of keywords, and the EDA deducted attributes were examined.