Devin.KR

데이터 분석·데이터 엔지니어 부트캠프

공개 교통·날씨 표본을 점검하고 분석한 뒤 중복 없는 처리와 품질 검사를 갖춘 프로젝트로 완성합니다.

대상
국비 웹 과정 수료생과 비전공 입문자를 대상으로 합니다. Python과 SQL 경험 없이 표의 행·열부터 시작합니다.
시작 전
파일 다운로드와 폴더 이동이 가능하면 시작할 수 있습니다. 첫 모듈에서 스프레드시트와 표를 익히고 SQL·Python 문법은 이후 모듈에서 배웁니다. 로컬 실습에는 Python 3와 스프레드시트 도구가 필요합니다.
학습 시간
130시간 안팎

트랙 프로젝트

공개 교통·날씨 데이터 분석 또는 수집 파이프라인

제공된 공개 교통·날씨 CSV 표본으로 지역·날짜별 통행량과 강수의 관계를 살핍니다. 출처 메타데이터부터 SQL 결합, Python 정제, 지표·그래프, 파일 기반 ETL, 중복 없는 SQLite 저장과 품질 게이트를 차례로 완성합니다. 마지막에는 분석 보고서 또는 수집 파이프라인 운영 인계서를 선택합니다.

수료하면 할 수 있는 일

  • 공개 데이터의 출처와 관측 단위를 기록하고 결측값 처리 결과를 비교합니다.
  • SQL 조인의 행 수와 집계값을 원본 표본으로 대조합니다.
  • Python으로 날짜와 숫자 자료형을 정리하는 스크립트를 작성합니다.
  • 지표의 분자와 분모를 정의하고 표와 그래프로 설명합니다.
  • 수집 파일을 재처리해도 중복되지 않는 저장 흐름을 구현합니다.
  • 품질 검사와 실행 방법을 함께 기록해 다른 사람이 결과를 재현하도록 합니다.
진도 0%

모듈

  1. 공개 데이터와 질문 정의

    교통량과 강수량을 비교할 질문과 데이터 계약을 작성합니다.

    10시간 안팎

    공개 데이터와 질문 정의 결과물 통합

  2. SQL 조회와 일별 집계

    원본 교통 표를 필터링하고 일별 비교 표를 만듭니다.

    12시간 안팎

    SQL 조회와 일별 집계 결과물 통합

  3. 교통과 날씨를 안전하게 결합

    키와 관측 단위를 맞춰 교통·날씨 결합 표를 만듭니다.

    12시간 안팎

    교통과 날씨를 안전하게 결합 결과물 통합

  4. Python 자료형과 정제

    결합 표의 날짜·숫자를 정리하고 결측 처리 영향을 비교합니다.

    14시간 안팎

    Python 자료형과 정제 결과물 통합

  5. 지표와 분포로 비교하기

    비 오는 날의 통행량을 정의된 지표와 분포로 비교합니다.

    12시간 안팎

    지표와 분포로 비교하기 결과물 통합

  6. 표와 그래프로 근거 제시

    축과 표본 수를 갖춘 그래프로 질문에 답합니다.

    12시간 안팎

    표와 그래프로 근거 제시 결과물 통합

  7. 수집·변환·저장 분리

    분석 코드를 파일 기반 ETL로 분리합니다.

    14시간 안팎

    수집·변환·저장 분리 결과물 통합

  8. 재실행과 중복 없는 저장

    같은 입력의 재처리와 실패 복구를 검증합니다.

    14시간 안팎

    재실행과 중복 없는 저장 결과물 통합

  9. 품질 검사와 수치 추적

    잘못된 데이터가 보고서로 전달되는 경로를 차단합니다.

    14시간 안팎

    품질 검사와 수치 추적 결과물 통합

  10. 분석 또는 파이프라인 완성

    다른 사람이 결과를 재현하고 판단 근거를 검토하도록 인계합니다.

    16시간 안팎

    분석 또는 파이프라인 완성 결과물 통합

신입 기본기 대응표

영역완료 기준모듈
데이터 이해
  • 데이터의 출처, 사용 조건, 수집 기간과 관측 단위를 확인합니다.
  • 결측값과 중복값을 구분하고 처리 전후의 행 수를 기록합니다.
m01-data-contractm04-python-cleaning
SQL과 테이블
  • 필터, 집계, 조인으로 질문에 필요한 데이터를 조회합니다.
  • 기본키와 조인 키의 중복 여부를 확인해 집계가 부풀어 오르는 원인을 설명합니다.
m02-sql-summarym03-join-keys
통계와 지표
  • 평균, 중앙값, 분포를 비교하고 이상값이 요약값에 미치는 영향을 설명합니다.
  • 지표의 분자, 분모, 기간과 제외 조건을 문서로 정의합니다.
m05-metrics-statistics
Python과 시각화
  • Python으로 파일을 읽고 자료형과 날짜 형식을 정리합니다.
  • 축, 단위, 표본 수를 표시한 그래프를 만들고 해석의 한계를 설명합니다.
m04-python-cleaningm06-visual-evidence
반복 가능한 처리
  • 수집, 변환, 저장 단계를 분리하고 실행 순서와 입력 스키마를 기록합니다.
  • 같은 입력을 다시 처리할 때 중복 적재되지 않도록 키와 저장 방식을 정합니다.
m07-etl-schemam08-idempotent-load
품질과 협업
  • 결측 비율, 키 중복, 값의 범위를 검사하는 코드를 작성합니다.
  • 개인정보를 필요한 범위로 제한하고 분석 또는 파이프라인의 재실행 방법을 공유합니다.
m09-quality-operationsm10-reproducible-delivery

면접 질문 대응