Devin.KR

분석 보고서 선택 경로

100분 안팎

학습 목표

분석 경로를 선택하면 교통·날씨 질문의 표·그래프·편향과 실험 가설·배정·비교 지표를 보고서로 정리합니다.

개념

보고서가 답할 질문을 한 문장으로 좁힙니다

분석 경로의 주 산출물은 읽는 사람이 판단할 수 있는 보고서입니다. 그래프를 많이 만드는 것보다 어느 기간의 어떤 관측 단위로 어떤 차이를 요약했는지를 먼저 정합니다. 이번 질문은 표본 기간의 지역·날짜에서 강수 그룹별 통행량이 어떻게 관찰되는가입니다. 분석가가 만든 표를 운영 담당도 재현할 수 있도록 metrics.json, chart-data.csv, 그림 메타데이터를 보고서 옆에 연결합니다. 관찰된 차이와 의사결정 제안은 근거의 강도에 맞게 구분합니다.

분석을 선택하면 route.json을 analysis로 두고 analysis.md를 자신의 문장으로 작성합니다. 파이프라인을 선택한 학습자는 이 레슨에서 상대 직무에게 물을 검토 질문을 제출합니다. 두 경로 모두 공통 파이프라인과 품질 검사를 버리지 않습니다. 문서 실습은 자동 채점으로 문장 품질을 판정하지 않으므로 제출 기준에 따라 동료가 검토합니다. 파일 존재 검사는 시작점이며 단위·분모·해석이 맞는지는 사람이 표본을 대조해 판단합니다.

분자와 분모가 보이는 표를 만듭니다

최종 강수 경계는 1mm 이상이고 기간은 2026-09-01부터 03까지입니다. 두 측정이 모두 있는 지역·날짜만 비교합니다. 강수 그룹은 합계 220, n=2이므로 평균 110.0이며 비강수는 합계 80, n=2로 평균 40.0입니다. 지역별 그룹마다 한 행이므로 중앙값도 그 행의 값과 같습니다. 전체 평균은 지역 평균의 단순 평균을 일반 규칙으로 삼지 않고 그룹 합계의 합을 n의 합으로 나눕니다. 지역별 관측 수가 달라지면 두 방법의 차이가 드러납니다.

결측 2행 제외와 실제 0대 보존을 같이 적습니다. 영점을 제외하면 비강수 평균이 올라가고, 강수 결측을 0mm로 바꾸면 모르는 날씨를 비강수 관측으로 바꾸게 됩니다. 결측 처리 전후의 유효 행 수와 지역별 결측률을 out/clean-audit.json에서 읽습니다. 결측이 특정 지역에 집중되어 비교 대상이 달라졌는지 검토합니다. 어떤 방식이 수치를 보기 좋게 만드는지로 선택하지 않고 질문과 측정 계약에 맞는 방식을 근거로 정합니다.

표와 그림의 독자를 맞춥니다

보고서에는 chart-data.csv의 지역·그룹·n·합계·평균·중앙값을 표로 넣고 means.svg를 같은 순서로 연결합니다. 축은 평균 통행량 대/지역·날짜이며 강수량 자체의 축이 아닙니다. figure-metadata.json의 기간과 표본 수를 함께 제공합니다. NA는 관측 없음이며 0대와 다른 표시입니다. 표와 그림의 수치가 다르면 보기 좋은 쪽을 선택하지 말고 지표 재생성 순서와 입력을 확인합니다. 독자가 그림만 보아도 단위와 표본 규모를 알 수 있도록 캡션을 작성합니다.

숫자의 자릿수와 문장 표현을 맞춥니다. 평균 110.0은 표시 규칙으로 소수 첫째 자리를 쓴 것이며 관측 정확도가 소수 단위로 높아졌다는 뜻은 아닙니다. 유효 n=4는 지역·날짜 수이지 사람 네 명이나 차량 네 대가 아닙니다. 작성자가 알고 있는 맥락을 독자가 자동으로 안다고 가정하지 않습니다. 보고서 첫 표 아래에 관측 단위, 기간, 제외, 그룹 경계를 한 번에 읽을 수 있게 적고 이후 문장에서는 그 정의를 일관되게 사용합니다.

관찰에서 인과로 건너뛰지 않습니다

이 합성 표본에서는 강수 그룹의 평균이 더 높습니다. 비가 통행을 늘린다는 결론은 지원하지 않습니다. 요일, 지역별 도로 규모, 행사, 관측 누락이 그룹 구성과 함께 달라질 수 있습니다. 표본의 날짜가 짧고 지역별 각 그룹은 한 행입니다. 여러 번 계산해 같은 숫자를 얻어도 이 제한은 줄어들지 않습니다. 결과에는 관찰 요약을 쓰고, 한계에는 비교 가능한 조건이 부족함을 쓰며, 다음 조사에는 긴 기간의 요일별 표본을 확보하는 행동을 연결합니다.

품질 게이트 통과는 키·범위·배치 결측 기준에 맞았다는 의미입니다. 표본 대표성이나 교란 통제가 끝났다는 표시가 아닙니다. 출처는 교육용 합성 자료이고 공개 기관 주소는 참고 위치이므로 실제 기관 데이터를 분석했다고 쓰지 않습니다. 현실 데이터로 확장한다면 출처·사용 조건과 수집 방법을 새로 확인합니다. 현재 보고서에 외부 자료를 확보한 것처럼 날짜나 승인자를 지어 넣지 않습니다. 검토자가 확인할 수 있는 파일과 실제 수행한 작업만 근거로 사용합니다.

실험에서는 바꿀 수 있는 개입을 정의합니다

강수 여부를 무작위 배정할 수 없으므로 비 효과의 실험이라고 부르지 않습니다. 다음 제안은 동의한 사용자에게 우천 안내 메시지를 제공하는 행동입니다. 가설은 안내가 이동 계획 확인률을 높일 수 있다는 것입니다. 사용자 단위로 안내군과 기존 화면군을 무작위 배정하고 기간 동안 배정을 유지하는 설계를 적습니다. 같은 사용자를 방문마다 다른 군에 넣으면 노출이 섞일 수 있습니다. 지역별 조건과 사용자 사이 메시지 공유도 효과 해석의 제한으로 점검합니다.

주 지표는 배정 뒤 7일 내 이동 계획을 확인한 사용자 수를 배정된 대상 사용자 수로 나눕니다. 메시지 클릭자만 분모에 넣으면 개입 이후의 행동으로 집단을 선택하여 원래 비교 질문을 바꿉니다. 보호 지표는 수신 거부율처럼 사용자 부담을 확인하는 값으로 둡니다. 이 네 지역·날짜 행은 사용자 실험의 표본이 아니므로 실험 규모를 정하는 근거로 사용할 수 없습니다. 사전 기준률, 변동성, 검출하고 싶은 차이를 확보하여 기간과 필요한 대상을 별도로 산정합니다.

실행한 분석과 제안한 실험을 구분합니다

analysis.md의 실험 제안에는 미실행이라고 씁니다. 배정 단위, 두 조건, 주 지표의 분자·분모, 보호 지표, 누락 처리, 중단·제외 기준을 결과를 보기 전에 합의하는 절차를 적습니다. 결과가 없으므로 효과 크기나 p값을 채우지 않습니다. 반복 재표집으로 숫자를 만든다고 실제 개입 자료가 생기지 않습니다. 더 읽기의 시뮬레이션 장은 계산의 불확실성을 확장하는 자료이며 여기서는 실험 질문과 관찰 질문의 경계를 명확히 하는 데 집중합니다.

검토 요청에는 다음 행동을 결정할 질문을 넣습니다. 예를 들어 특정 지역의 강수 누락이 늘면 전체 결측률 통과에도 공개를 보류해야 하는지 운영 담당에게 묻습니다. 보고서의 약점을 숨기기보다 어떤 추가 자료가 있으면 판단이 달라지는지를 적습니다. 문서 완성 뒤 표의 각 수치를 파일 경로와 연결하고 그림의 축·n·기간을 직접 확인합니다. 다른 경로를 선택한 사람도 표본 수와 편향을 묻는 질문을 남기면 분석과 운영이 같은 품질 기준을 논의할 수 있습니다.

따라하기

그룹 가중 평균

다음 독립 예제를 Python으로 실행하여 판단 기준을 확인합니다.

for group,total,n in [('rain',220,2),('dry',80,2)]:
    print(group,'n='+str(n),'mean='+format(total/n,'.1f'))

실행 결과

rain n=2 mean=110.0
dry n=2 mean=40.0

영점의 분모 유지

다음 독립 예제를 Python으로 실행하여 판단 기준을 확인합니다.

values=[80,0]
print('n',len(values),'mean',format(sum(values)/len(values),'.1f'))

실행 결과

n 2 mean 40.0

실험 지표 분모 점검

다음 독립 예제를 Python으로 실행하여 판단 기준을 확인합니다.

assigned=100; clicked=20; confirmed=10
print('assigned_rate',format(confirmed/assigned,'.2f'))
print('clicker_rate',format(confirmed/clicked,'.2f'))

실행 결과

assigned_rate 0.10
clicker_rate 0.50

확인 문제

실습

analysis.md에 질문·기간·단위·강수 경계·결측 전후 n·가중 평균 표와 그림 경로·편향·인과 한계를 적습니다. 미실행 실험의 가설·개입·배정 단위·비교 조건·주 지표 분자와 분모·보호 지표·사전 제외 기준을 제안합니다. 분석을 선택하지 않으면 운영 담당이 분석가에게 물을 검토 질문을 제출합니다.

더 읽기

면접 질문

  • 평균만으로 사용자의 행동을 설명하기 어려운 사례를 설명해 주시면 됩니다.
  • 공개 데이터로 만든 그래프의 신뢰성을 확인하는 방법을 설명해 주시면 됩니다.