
안녕하세요! 두부쌤입니다~
데이터 분석 수업에서 학생들이 숫자와 그래프를 실제 세상의 문제와 연결해 보게 하려면 어떤 주제가 좋을까요? 이번에는 “범죄는 도시의 어느 곳에서 많이 발생할까?”라는 질문에서 출발해 보았습니다. 같은 도시 안에서도 사건이 발생하는 위치와 분포가 다르다는 점에 주목하면, 데이터를 지도 위에 표현하고 그 안에서 의미를 찾는 탐구로 이어 갈 수 있습니다.
이번 글에서는 학생들과 함께 진행했던 ‘범죄 데이터로 알아보는 지리적 프로파일링’ 프로젝트를 소개합니다. 미국 로스앤젤레스의 공개 범죄 데이터를 활용해 데이터를 정리하고, 범죄 유형별 발생 건수를 비교한 뒤, 차량 절도 사건의 위치를 지도에 시각화합니다. 이어 DBSCAN 군집화 알고리즘으로 사건이 모여 있는 지역을 살펴봅니다.
수업의 핵심은 분석 도구를 사용하는 데서 한 걸음 더 나아가, 결과를 읽고 새로운 질문을 던지는 데 있습니다. 학생들이 “왜 이 지역에 사건이 많이 모여 있을까?”, “이를 설명하려면 어떤 정보가 더 필요할까?”를 생각하며 주변 환경을 조사하도록 합니다. 데이터에 나타난 특징과 그 원인을 구분하는 태도까지 함께 기를 수 있도록, 데이터 수집부터 분석 결과 해석까지의 과정을 차례로 공유하겠습니다.
<aside>
지리적 프로파일링(Geographic Profiling)은 범죄 사건이 발생한 위치와 사건 간의 거리, 공간적 분포 등을 분석하여 범죄자의 주요 활동 지역이나 거주 가능 지역을 추정하는 분석 방법입니다.
쉽게 말하면 지도 위에 흩어져 있는 여러 위치 데이터를 분석하여 어느 지역을 중심으로 이런 현상이 나타나고 있을지를 찾아보는 것입니다.
</aside>
이번 프로젝트에서는 지리적 프로파일링 자체를 수행하기보다, 그 과정에서 활용되는 공간 분석의 원리를 실제 범죄 데이터에 적용해 봅니다. 데이터 분석에는 2020년부터 2023년까지 미국 로스앤젤레스에서 기록된 범죄 데이터를 활용하며, 범죄 유형과 위도, 경도 등의 위치 정보를 중심으로 분석합니다.
먼저 범죄 유형별 발생 건수를 살펴보고, 가장 많이 발생한 사건을 분석 대상으로 선택합니다. 이후 해당 사건의 위치를 히트맵으로 나타내어 전체적인 분포와 사건이 집중된 지역을 확인합니다.
하지만 히트맵만으로는 서로 가까운 곳에서 발생한 사건들을 명확한 집단으로 구분하기 어렵습니다. 따라서 DBSCAN 군집화 알고리즘을 활용하여 서로 가까운 위치에서 발생한 사건들을 여러 군집으로 구분하고, 각 군집의 중심 위치와 사건이 가장 많이 모여 있는 구역을 찾아 지도에서 확인합니다.
이번 프로젝트에서는 이처럼 실제 범죄 데이터를 지도에 시각화하고 인공지능의 군집화 알고리즘을 활용하여 분석하면서, 많은 위치 데이터 속에 숨어 있는 공간적 패턴을 찾아봅니다.
이번 프로젝트에서는 실제 범죄 발생 위치를 분석하기 위해 캐글(Kaggle)에 공개된 ‘Los Angeles Crime Dataset 2020–Present’ 데이터를 활용했습니다.
이 데이터는 2020년부터 2023년까지 미국 로스앤젤레스에서 기록된 범죄 데이터를 정리한 것으로 범죄가 발생한 날짜와 시간, 범죄 유형, 발생 지역 등의 정보를 포함하고 있습니다. 특히 각 사건이 발생한 위치의 위도와 경도 정보가 함께 제공되어 실제 범죄 발생 위치를 지도 위에 나타내고 공간적인 분포를 분석할 수 있습니다.
전체 데이터 중 범죄 유형과 위도, 경도를 중심으로 활용하여 범죄 발생 위치를 지도에 시각화하고, 인공지능을 이용해 범죄가 집중적으로 발생하는 지역과 공간적 패턴을 찾아보았습니다.
데이터 링크: https://www.kaggle.com/datasets/nathaniellybrand/los-angeles-crime-dataset-2020-present