projects

데이터 분포 섹션 — 질문과 검증의 사슬

데이터 분포 섹션 — 질문과 검증의 사슬

대질문: 회귀의 가정과 이 데이터는 얼마나 떨어져 있는가 — 그 거리를 어떻게 좁힐 것인가? 방법: 가정별로 거리를 측정 → 측정값이 임계값과 비교되어 전처리를 결정 (취향이 아니라 측정의 귀결)

공통 리듬

모든 소질문이 같은 4박자: 도구 → 실측 → 판정 기준 → 결정

Q1. store·item은 쓸 만한 신호인가, 얼마나 큰가? (입력 선택)

단계내용
도구ANOVA F → (큰 표본 함정) → effect size η²
실측F: 2,463 / 4,418 (p≈0, n=130K라 무정보) → η²: store 14.57% / item 62.49%
판정Cohen ≥ 0.14 = LARGE — 둘 다 통과, item 4배
결정둘 다 포함, item 주 신호 + joint η² 79.49% = 천장 (Stage 1 가설로 승격)

Q2. 신호의 형태 — 합인가 조합인가? (표현 형태)

단계내용
도구Interaction Ratio = Var(joint평균 − additive예측) / Var(joint평균)
실측28,450 = additive 27,582 (96.9%) + interaction 868 (3.1%) → IR 3.05%
판정≤ 5% = additive 충분
결정곱셈항(500개) 불도입 — 이득 상한이 3%

Q3. noise의 형태 — 등분산·정규 가정과 맞나? (변환 결정)

단계내용
도구그룹 μ vs σ의 Pearson r (+ CV 교차)
실측r = +1.0000 (둘 다) · CV 0.47/0.29 상수
판정r ≈ 1 → σ∝μ → 곱셈 noise (y ≈ μ·ε) → 등분산 위반
결정log 변환 (곱→합) — Linear·SVR만, tree 제외(단조 불변). 사후: 잔차 skew +0.06 정규 회복

Q4. OneHot 표현이 수학적으로 안전한가? (인코딩 검증)

단계내용
도구rank 검정 → drop='first' → VIF
실측rank 59/60 (결손) → 58/58 (회복) → VIF max 1.96
판정Kutner 10의 1/5 — 잔여 공선성 무시 가능
결정OneHot + drop='first', 추가 조치 불필요 — 계수 해석 안정성 근거

산출물 (네 답의 합)

  • 전처리 파이프라인: OneHot + drop='first' + log(Linear·SVR) + interaction 없음
  • 천장 0.7949 — 측정이 가설이 된 지점

발표 한 줄: "가정마다 거리를 쟀고, 잰 값이 전처리를 정했고, 그 과정에서 천장이라는 가설까지 공짜로 얻었다."

예상 질문

  1. "순서가 왜 이렇게 되나?" → Q1(무엇을 넣나) → Q2(어떤 형태로) → Q3(target은 어떻게) → Q4(안전한가) — 입력 선택에서 검증으로 흐르는 자연 순서.
  2. "전부 임계값 기준 판정인데 임계값 근거는?" → Cohen(η²)·Kutner(VIF)는 문헌 표준, IR 5%는 자체 휴리스틱(명시) — 단 실측이 극단 구간(3.05%, 1.96, r=1.00)이라 임계값 민감도가 낮다.
  3. "σ-μ에서 r이 정확히 1.0000일 수 있나?" → 그룹 '평균 vs 표준편차' 10개·50개 점의 상관 — 판매량처럼 규모가 지배하는 데이터에서 거의 완전 비례가 나온다. 소수점 4자리 반올림 값.